DeepSeek V4 Pro开源权重与Harness框架双发:补齐Vibe Coding全链路的最后一环

2026年8月13日晚间,DeepSeek在短短一天之内连放两记重拳:旗舰模型V4-Pro-0813权重正式开源,同时推出基于Cordis内核的代码智能体框架Harness v0.1开发者预览版(MIT协议)。截至8月14日,GitHub仓库已斩获2.75万星。这不是一次普通的模型迭代——它标志着DeepSeek从"做大模型"正式转向"做能干活的智能体",一条从模型推理到真实环境执行的完整链路就此打通。

一、V4-Pro-0813:开源旗舰模型的硬实力

1.1 架构与参数

DeepSeek-V4-Pro-0813延续了V4系列的混合专家(MoE)架构,总参数量1.6万亿,单次前向传播激活49B参数。模型采用混合注意力设计——压缩稀疏注意力(CSA)与重度压缩注意力(HCA)协同工作,配合流形约束超连接(mHC),原生支持100万Token上下文窗口,单次最高输出384K Token。精度方面,MoE专家层使用FP4,其余部分采用FP8混合精度,在保证推理质量的同时大幅降低显存占用。

模型提供三档推理模式供开发者灵活选择:

  • Non-think(快速模式):不生成链式思考,低延迟,适合分类、抽取、结构化输出等不需要深度推理的任务。

  • Think(标准模式):标准链式思考推理,是编码、数学和多步骤任务的默认选择。

  • Max(最大推理模式):扩展推理预算,在准确率比速度更重要的场景下使用——复杂证明、高难度竞赛编程、深度调试等。
  • 三档模式均通过同一API端点访问,切换方式为提示词级别的指令,无需更换模型ID,这意味着开发者可以在应用中实现自适应模式选择而无需更改API配置。

    1.2 编程基准表现

    在编程类基准测试中,V4-Pro-0813展现出顶尖水平:

    | 基准测试 | V4-Pro-0813 | 说明 |
    |---|---|---|
    | LiveCodeBench (Pass@1) | 93.5 | 所有评测模型第一 |
    | Codeforces Rating | 3206 | 所有评测模型第一 |
    | SWE-Verified | 80.6 | 与Claude Opus持平 |
    | Terminal Bench 2.1 | 87.9 | 智能体终端操作领先 |
    | DeepSWE | 62.7 | 软件工程智能体大幅提升 |
    | DSBench-FullStack | 71.1 | 全栈开发基准领先 |

    需要特别注意的是一个行业共识:V4-Pro在Terminal Bench 2.1、DeepSWE等智能体编程基准上的成绩,反映的是模型、推理配置与执行环境共同组成的系统表现。这些评测正是在Harness的Minimal模式下完成的——该模式仅保留持久化bash和str_replace_editor两个工具,最大程度减少框架对结果的干扰。这意味着,脱离Harness单独评估模型能力,可能无法完全复现官方成绩。调度框架本身已经成为决定AI编码效果的关键变量。

    二、Harness:让模型真正"干活"的运行底座

    2.1 定位:不是新模型,是Agent的调度框架

    很多开发者第一眼会误以为DSH是全新大模型或简单的API封装工具。官方明确给出定位:它是一套完整的Agent调度框架,核心作用是把大模型能力对接本地文件、终端、代码编辑器、网页、多智能体,统一管理上下文压缩、工具调用、任务循环、失败重试。

    用一句话概括核心公式:Model + Harness = 可落地执行的智能体。模型负责思考推理,Harness负责落地干活。传统对话AI仅能返回代码片段,而Coding Agent需要循环执行"读项目→改文件→跑终端→查报错→迭代修复",这套闭环的调度逻辑全部由Harness承载。

    2.2 四种运行模式

    Harness提供四种预设运行模式,覆盖从基准测试到生产开发的全场景:

  • Standard模式:全功能编码智能体,包含文件编辑、Shell、文件与网页搜索、技能系统、规划、目标管理、子智能体和工作流。这是日常开发的首选。

  • Code模式:在Standard模式基础上,通过Code Mode SDK将工具暴露给模型,让模型编写TypeScript程序来编排多步骤操作。模型可以先规划再执行,在单轮中完成复杂的多工具协作。这与Aider的架构师模式和Claude Code的思考工具使用模式异曲同工。

  • Minimal模式:仅保留持久化bash和str_replace_editor两个工具,专为基准测试设计。它最大程度减少框架对结果的影响,让模型能力成为决定性变量,同时让不同模型之间的评测具备可比性。

  • Creator模式:面向构建自定义Agent预设的开发环境,支持运行时检查、内存中插件实验和预设编写指导。开发者可以在此模式下组装新的运行模式,测试插件组合效果。
  • 2.3 全链路可追溯

    Harness强制记录模型所见的一切信息:系统提示词、推理过程、工具调用及其结果、子智能体调度、每一次上下文注入。所有记录写入只追加(append-only)的Session Log,在Trajectory视图中可按来源逐条检查。

    基于这套事件流,开发者可以执行四类操作:

  • 恢复(Resume):从任意断点继续执行,无需从头开始

  • 分叉(Fork):从某个节点创建分支,探索不同执行路径

  • 搜索(Search):在完整事件流中检索关键操作和决策点

  • 回放(Replay):精确复现某次运行,用于调试和对比
  • 这种级别的可观测性不仅是调试利器,更是进行严肃模型评测的前提。如果你要对比模型A和模型B在编码任务上的表现差异,你需要看到每个模型实际看到了什么、做了什么——而不仅仅是最终输出。Harness从设计层面保证了这一点。

    2.4 多端形态全覆盖

    同一套Harness底层,提供四种交互形态,覆盖全开发场景:

  • Web UI:可视化工作台,拖拽项目文件夹,AI自主阅读工程结构、修改代码、运行测试、定位Bug。

  • TUI终端界面:纯命令行操作,适合习惯终端的开发者和远程服务器场景。

  • Headless无界面模式:对接CI/CD和自动化脚本,自动完成代码巡检、单测执行。

  • SDK自动化接口:支持Python、JSON-RPC、ACP协议,可集成到自有平台和内部研发系统。
  • 三、Cordis内核:一切皆插件的理论基石

    3.1 从Koishi到通用元框架

    Cordis(拉丁语意为"心")是一个元框架——即"用于构建框架的框架"。它不耦合任何具体业务领域,只专注于解决一个核心问题:如何让软件的各个组件可以安全地组合、热插拔,并在卸载时完整逆转其所有副作用。

    Cordis最初从知名聊天机器人框架Koishi中抽离,作为底层插件系统独立发展。Koishi支持QQ、微信、飞书、Telegram等多平台,其核心设计哲学是"插件即一切"——所有功能通过插件实现且支持运行时热更新。随着这套插件系统逐渐成熟,开发者意识到它解决的依赖管理、生命周期控制、副作用追踪与回滚问题,是几乎所有复杂软件系统都会面临的共性挑战。于是Cordis被剥离为独立项目。

    2026年8月,北京大学与DeepSeek-AI联合发表论文《A Programming Paradigm for Spatiotemporal Composability》,为Cordis的设计建立了形式化模型,将其核心理念概括为"时空可组合性"。Cordis的核心实现仅约2000行TypeScript代码,心智负担极低。

    3.2 时空可组合性

    Cordis的设计哲学浓缩为两个维度:

    时间可组合性(Temporal Composability):任何组件在撤出时,必须能够完整逆转其产生的所有副作用。传统软件架构中,组件安装后往往难以干净卸载——注册的事件监听器、打开的文件句柄、修改的全局状态常常残留,导致内存泄漏、状态污染甚至系统崩溃。Cordis要求所有副作用操作都返回撤销函数,内部维护副作用栈,卸载时自动按逆序清理。

    空间可组合性(Spatial Composability):任何组件必须显式声明其依赖的服务,系统据此自动编排加载顺序。当依赖关系发生变化时,系统自动调整相关组件的生命周期。这消除了隐式依赖带来的加载顺序错误和运行时崩溃风险。

    简言之,系统既需要知道一个组件"做了什么"(时间维度——可逆),也需要知道它"需要什么"(空间维度——可组合)。两个维度共同作用,使得系统可以在长期运行中经历无数次组件增删改而保持一致性。

    3.3 可逆效应机制

    这是Cordis最独特的设计。所有副作用操作通过上下文注册,并返回一个撤销函数(disposer):

    typescript
    // 注册事件监听 — 返回disposer,卸载时自动调用
    ctx.on('message', (session) => {
      console.log('收到消息:', session.content)
    })
    
    // 注册自定义副作用 — 显式返回清理函数
    ctx.effect(() => {
      const conn = createDatabaseConnection(config)
      return () => conn.close() // 返回disposer
    })
    
    // 事务化加载:配置更新时原子性加载
    // 任何步骤失败则整体回滚,不会出现"装了一半"的残局
    ctx.plugin(myPlugin, config)

    当插件被卸载或重载时,Cordis自动调用所有disposer,确保资源完全释放。配合事务化加载机制——配置更新时原子性地加载新配置,任何步骤失败则整体回滚——系统状态始终保持一致。

    据Cordis团队分享,基于该框架构建的Koishi服务在三年间经历了无数次插件热更新,进程从未重启。这种"永不停机"的特性对于需要长期运行的Agent服务至关重要。

    3.4 五大核心概念

    使用Cordis需要理解五个核心概念:

  • 插件(Plugin):功能的唯一来源。可以是带inject属性和apply(ctx)方法的函数,也可以是继承自Service的类。所有Agent能力——模型、工具、技能、会话、沙箱、存储、循环、调度、UI——均为插件。

  • 上下文(Context):服务的容器。每个服务占据稳定的上下文键(如ctx.toolsctx.llmctx.database),提供统一命名空间,避免全局污染。

  • 依赖注入(inject):插件通过inject声明所需服务,Cordis自动解析依赖图,确保服务按正确顺序加载:
  • typescript
    const myPlugin = {
      inject: ['llm', 'tools'],  // 声明依赖
      apply(ctx) {
        // 此时 ctx.llm 和 ctx.tools 已保证可用
        ctx.llm.chat('请分析这段代码的性能瓶颈')
      }
    }

  • 类型化事件:支持四种分发模式——emit(广播,不等待回调)、waterfall(瀑布传递,每个监听器可修改参数)、parallel(并行调用所有监听器)、serial(串行调用,前一个完成才调用下一个)。所有事件通过ctx.on()注册,天然享受可逆副作用保障。

  • 可逆副作用:所有副作用操作天然享受卸载时的自动清理。每个插件拥有独立的生命周期状态机(PENDING -> LOADING -> ACTIVE -> DISPOSED),确保状态转换的确定性。
  • 四、实战:从零搭建你的第一个Harness智能体

    4.1 快速启动

    安装Node.js后,一行命令启动Web UI:

    bash
    # 一键启动Web UI
    npx @deepseek-ai/dsh web
    
    # 或从源码克隆进行二次开发
    git clone https://github.com/deepseek-ai/deepseek-harness
    cd deepseek-harness
    npm install
    npm run dev

    4.2 配置自定义模型与工具链

    Harness的"一切皆插件"理念意味着你可以替换任何组件。以下是通过配置文件指定模型提供商、工具集和执行策略的示例:

    yaml
    # dsh.config.yaml
    plugins:
      model:
        provider: deepseek
        model: deepseek-v4-pro
        apiKey: ${DEEPSEEK_API_KEY}
        reasoningEffort: max      # 使用最大推理模式
        temperature: 1.0
        topP: 0.95
      tools:
        - file-editor             # 文件读写与编辑
        - shell                   # 终端命令执行
        - web-search              # 网页搜索
        - str_replace_editor      # 精确字符串替换
      sandbox:
        type: docker              # Docker沙箱隔离
        workdir: /workspace
      loop:
        strategy: reactive        # 反应式循环策略
        maxIterations: 50         # 最大迭代次数
        retryOnFailure: true      # 失败自动重试
      storage:
        type: local               # 本地存储
        path: ~/.dsh/sessions

    无需修改框架源码,仅通过配置即可完成模型、工具、沙箱、循环策略的全部定制。

    4.3 编写自定义工具插件

    开发者可以编写自己的工具插件并注册到Harness中。以下是一个数据库查询工具插件的完整示例:

    typescript
    import { Context, Service } from 'cordis'
    
    // 定义数据库服务
    class DatabaseService extends Service {
      constructor(ctx: Context) {
        super(ctx, 'database', true)
      }
    
      async query(sql: string) {
        // 执行数据库查询并返回结果
        const result = await this.execute(sql)
        return result
      }
    
      private async execute(sql: string) {
        // 实际查询逻辑...
      }
    }
    
    // 注册工具插件
    const databasePlugin = {
      inject: ['tools'],  // 依赖工具服务
      apply(ctx: Context) {
        // 注册为模型可调用的工具
        ctx.tools.register('database_query', {
          description: 'Execute a read-only SQL query on the project database',
          parameters: {
            sql: {
              type: 'string',
              description: 'The SQL statement to execute'
            }
          },
          handler: async (args: { sql: string }) => {
            const db = ctx.database
            const rows = await db.query(args.sql)
            return JSON.stringify(rows, null, 2)
          }
        })
      }
    }
    
    export default databasePlugin

    4.4 多智能体协作配置

    Harness支持主智能体自动拆解任务、分派子智能体并行工作。以下是一个典型的多智能体协作配置:

    typescript
    const projectConfig = {
      mode: 'standard',
      subagents: {
        // 研究员:负责查阅文档和技术资料
        researcher: {
          description: '查找相关文档、API参考和技术资料',
          tools: ['web-search', 'file-reader'],
          model: 'deepseek-v4-pro',
          reasoningEffort: 'think'
        },
        // 程序员:负责编写和修改代码
        coder: {
          description: '编写和修改源代码文件',
          tools: ['file-editor', 'shell', 'str_replace_editor'],
          model: 'deepseek-v4-pro',
          reasoningEffort: 'max'
        },
        // 测试员:负责运行测试并验证结果
        tester: {
          description: '运行单元测试、集成测试并验证修复效果',
          tools: ['shell', 'file-reader'],
          model: 'deepseek-v4-flash',
          reasoningEffort: 'think'
        }
      },
      // 主智能体调度策略
      orchestrator: {
        maxParallelSubagents: 3,
        summarizeStrategy: 'merge-and-review',
        maxIterations: 20
      }
    }

    主节点会根据任务类型自动调度:研究员查阅文档、程序员修改代码、测试员运行验证,三者并行推进。主节点汇总各子智能体的结果,持续迭代直到任务完成。这种机制突破了传统一问一答的交互限制,支持数小时级别的超长连续任务。

    五、正面宣战:Harness vs Claude Code vs Codex

    5.1 三大框架横向对比

    | 维度 | DeepSeek Harness | Claude Code | OpenAI Codex |
    |---|---|---|---|
    | 开源协议 | MIT(完全开源) | 闭源 | 闭源 |
    | 模型绑定 | 任意OpenAI兼容模型 | 仅Claude系列 | 仅GPT系列 |
    | 架构理念 | 一切皆插件 | 封闭集成 | 封闭集成 |
    | 可定制性 | 极高(插件级替换) | 低 | 低 |
    | 运行模式 | 4种预设 | 单一模式 | 单一模式 |
    | 多智能体 | 原生支持 | 支持 | 支持 |
    | 可追溯性 | 全链路Session Log | 有限 | 有限 |
    | 私有化部署 | 完全支持 | 受限 | 受限 |
    | 社区生态 | 开放插件市场 | 封闭 | 封闭 |
    | 成本 | 约为Claude的1/30 | Anthropic定价 | OpenAI定价 |

    5.2 差异化优势:可逆性与可组合性

    Harness与Claude Code、Codex的根本区别在于"可逆性"和"可组合性"两个维度。

    Claude Code和Codex都是封闭的成品工具——开发者使用它们,但不能修改它们的内部机制。如果模型需要更换、工具需要定制、循环策略需要调整,开发者要么接受既有设计,要么从头造轮子。

    Harness将这种封闭性彻底打破。模型适配器、工具注册、Session Log、甚至驱动模型反复调用工具的Agent Loop本身,都只是可替换的插件。开发者无需修改框架源码,仅通过配置文件即可替换、新增、组合任意模块。

    更激进的是,Harness的Creator模式允许Agent在运行时检查当前Cordis环境,临时定义、加载、卸载新组件。这意味着Agent不只是调用现有工具——它可以直接修改自己所处的运行时框架。

    5.3 递归自我改进的雏形

    这一设计直接指向一个前沿方向:递归自我改进。AI要持续改进自身,不一定需要先修改最具挑战性的模型权重。提示词、上下文、工具、工作流、甚至Agent Loop本身,都可以成为改进对象。Cordis将Harness从硬编码程序转变为一组可持续组合、替换、卸载的零件,DeepSeek甚至将运行时接口的操作权交给了Agent本身。

    如果未来的递归自我改进从Harness而非模型权重开始,Cordis提供了关键基础:让模型、工具、上下文、Session乃至Agent Loop,从固定设计转变为可被机器重组的对象。这或许是这次发布中最具长期想象力的部分。

    六、API调价与私有化部署的深层逻辑

    6.1 价格调整预告

    DeepSeek同步预告8月17日起上调云端API调用价格。这一时间节点选择颇有深意:恰好在V4-Pro权重开源和Harness发布之后,为开发者提供了完整的本地替代方案。

    6.2 推动私有化部署

    调价的战略意图清晰:推动企业加快私有化本地部署。V4-Pro权重以MIT协议开源,配合Harness的完整本地运行能力,企业可以在自有基础设施上构建完全可控的AI编程工作台,无需依赖云端API。

    私有化部署的优势显而易见:

  • 成本可控:一次性硬件投入替代持续的API调用费用,高频场景下边际成本趋近于零

  • 数据安全:代码和业务数据不出本地环境,满足数据主权要求

  • 定制灵活:可针对特定技术栈优化模型和工具链,编写行业专属插件

  • 合规保障:满足金融、医疗、政务等行业的严格监管要求

  • 离线可用:不依赖网络连接,保障开发流程的稳定性
  • 6.3 商业模式转变

    这一策略反映出DeepSeek商业逻辑的深层转变:不再单纯依靠API调用收费,而是通过"开源模型+开源框架"建立生态护城河,将价值捕获从按量计费转向私有化部署服务、企业级支持、定制化开发等更高附加值的领域。当模型和框架都是开源的,竞争壁垒就从技术垄断转向生态规模和服务质量。

    七、Vibe Coding全链路:从概念到工程闭环

    7.1 Vibe Coding的起源与演进

    2025年2月,Andrej Karpathy在X上提出"Vibe Coding"概念,描述了一种全新的编程范式:开发者用自然语言与AI交流,接受AI的建议,几乎不阅读生成的代码。他坦言自己会用最随意的方式提出需求,比如"把侧边栏的padding减小一半",因为懒得自己去找。这一概念迅速走红,获得超过450万次浏览,2025年11月被Collins词典评为年度词汇,Merriam-Webster也在2026年3月将其收入词条。

    但Vibe Coding从概念到工程落地,始终缺少一个关键环节:一个能让AI真正进入项目环境、循环执行"读项目→改文件→跑终端→查报错→迭代修复"的运行框架。在此之前的AI编程工具,要么只能生成代码片段(需要人工复制粘贴),要么是封闭的成品工具(无法定制)。

    7.2 全链路补齐

    DeepSeek的V4-Pro + Harness组合,正是补齐了这最后一环,形成了完整的五层架构:

  • 模型层:V4-Pro提供强大的代码理解和生成能力,100万Token上下文可容纳整个代码仓库,93.5的LiveCodeBench成绩保证了生成质量。

  • 执行层:Harness提供从文件操作到终端执行的完整工具链,AI可以直接读写文件、运行命令、查看结果。

  • 调度层:Agent Loop统一管理任务循环、上下文压缩、失败重试,让AI能够持续迭代而不中断。

  • 协作层:多智能体分工机制支持复杂项目的并行开发,研究员、程序员、测试员各司其职。

  • 可观测层:Session Log提供全链路追溯和回放能力,让每一次AI操作都可审计、可复现。
  • 这五个层次构成了完整的Vibe Coding工程闭环,让"用自然语言指挥AI完成完整开发任务"从概念演示变为可重复的工程实践。

    7.3 成本结构的改变

    传统AI编程的成本主要集中在API调用上。以V4-Pro为例,虽然其API定价已远低于Claude和GPT系列(输入约为Claude Opus的1/8,输出约为1/21),但长期高频调用的累计成本依然可观。Harness的本地化部署能力改变了这一成本结构:企业部署本地GPU集群运行V4-Pro权重,配合Harness进行开发,单次推理的边际成本趋近于零。这在每日数百次迭代的场景下,具有显著的长期成本优势。

    八、行业影响与未来展望

    8.1 竞争赛道切换

    V4-Pro + Harness的组合标志着AI编码竞争从"模型参数竞赛"切换到"执行层竞赛"。过去,大模型厂商的竞争焦点集中在参数规模、开源权重、API定价;而现在,模型与真实环境的执行层成为新战场。

    OpenAI早已将Codex的本地调度层命名为Harness,推出桌面端多智能体和电脑操作能力。Anthropic的Claude Code主打本地代码工程交互。AI编码之所以成为智能体能力的最佳试验场,核心在于代码拥有客观、可自动化验证的反馈:编译报错、测试用例、终端日志能直接形成"执行-反馈-修正"闭环,持续训练智能体的规划、纠错和长任务处理能力。Harness掌控这套闭环的完整流程,让DeepSeek拥有了自研可控的智能体执行标准。

    8.2 开源生态的催化效应

    MIT协议开源意味着Harness可以被任何团队自由使用、修改和分发。配合开放的插件生态系统(GitHub dsh-plugin话题),这有望催生一个繁荣的社区生态:

  • 模型适配器:支持更多开源和闭源模型接入,不限于DeepSeek自家的模型

  • 工具插件:覆盖各类开发场景的专业工具,从数据库操作到云服务部署

  • 行业预设:针对金融、医疗、游戏等垂直领域的定制化Agent配置

  • 评测框架:基于Minimal模式的标准化模型评测工具,让不同模型的对比更加公平
  • 截至8月14日,GitHub仓库已获2.75万星,社区插件生态正在快速生长。这个增长速度在开源AI工具中属于第一梯队。

    8.3 未来路线展望

    从DeepSeek的产品节奏可以窥见清晰的路线图:

  • 模型持续优化:在编程基准上保持领先,同时提升通用推理和知识能力

  • 框架走向稳定:Harness从开发者预览版迭代至稳定版,核心API趋于固化

  • 生态建设:吸引社区贡献者和企业用户,形成插件市场的网络效应

  • 企业服务:提供私有化部署的企业级支持、SLA保障和定制开发

  • 探索前沿:利用Cordis的可组合性探索递归自我改进,让Agent持续优化自身
  • 结语

    DeepSeek V4-Pro-0813权重开源与Harness框架发布,不是孤立的产品迭代,而是一次系统性的战略转向。从"提供强模型"到"提供能干活的智能体基础设施",DeepSeek正在重新定义自己在AI生态中的角色。

    模型决定智能上限,Harness决定智能能否落地。当两者以MIT协议开源的形式交到全球开发者手中时,AI编程的竞争格局正在被改写。对于开发者而言,现在既有了一个在编程基准上顶尖的开源模型,又有了一个架构理念领先的开源智能体框架——Vibe Coding的全链路,终于在工程层面被打通。

    而更深层的意义在于:Cordis的"时空可组合性"范式和"可逆效应"机制,为AI智能体从"执行预设指令"走向"持续自我改进"提供了理论基础和工程路径。如果这条路径被验证可行,它的影响将远超AI编程本身。

    💬 评论区 (0)

    暂无评论,快来抢沙发吧!