一、V4-Pro-0813:开源旗舰模型的硬实力
1.1 架构与参数
DeepSeek-V4-Pro-0813延续了V4系列的混合专家(MoE)架构,总参数量1.6万亿,单次前向传播激活49B参数。模型采用混合注意力设计——压缩稀疏注意力(CSA)与重度压缩注意力(HCA)协同工作,配合流形约束超连接(mHC),原生支持100万Token上下文窗口,单次最高输出384K Token。精度方面,MoE专家层使用FP4,其余部分采用FP8混合精度,在保证推理质量的同时大幅降低显存占用。
模型提供三档推理模式供开发者灵活选择:
三档模式均通过同一API端点访问,切换方式为提示词级别的指令,无需更换模型ID,这意味着开发者可以在应用中实现自适应模式选择而无需更改API配置。
1.2 编程基准表现
在编程类基准测试中,V4-Pro-0813展现出顶尖水平:
| 基准测试 | V4-Pro-0813 | 说明 |
|---|---|---|
| LiveCodeBench (Pass@1) | 93.5 | 所有评测模型第一 |
| Codeforces Rating | 3206 | 所有评测模型第一 |
| SWE-Verified | 80.6 | 与Claude Opus持平 |
| Terminal Bench 2.1 | 87.9 | 智能体终端操作领先 |
| DeepSWE | 62.7 | 软件工程智能体大幅提升 |
| DSBench-FullStack | 71.1 | 全栈开发基准领先 |
需要特别注意的是一个行业共识:V4-Pro在Terminal Bench 2.1、DeepSWE等智能体编程基准上的成绩,反映的是模型、推理配置与执行环境共同组成的系统表现。这些评测正是在Harness的Minimal模式下完成的——该模式仅保留持久化bash和str_replace_editor两个工具,最大程度减少框架对结果的干扰。这意味着,脱离Harness单独评估模型能力,可能无法完全复现官方成绩。调度框架本身已经成为决定AI编码效果的关键变量。
二、Harness:让模型真正"干活"的运行底座
2.1 定位:不是新模型,是Agent的调度框架
很多开发者第一眼会误以为DSH是全新大模型或简单的API封装工具。官方明确给出定位:它是一套完整的Agent调度框架,核心作用是把大模型能力对接本地文件、终端、代码编辑器、网页、多智能体,统一管理上下文压缩、工具调用、任务循环、失败重试。
用一句话概括核心公式:Model + Harness = 可落地执行的智能体。模型负责思考推理,Harness负责落地干活。传统对话AI仅能返回代码片段,而Coding Agent需要循环执行"读项目→改文件→跑终端→查报错→迭代修复",这套闭环的调度逻辑全部由Harness承载。
2.2 四种运行模式
Harness提供四种预设运行模式,覆盖从基准测试到生产开发的全场景:
2.3 全链路可追溯
Harness强制记录模型所见的一切信息:系统提示词、推理过程、工具调用及其结果、子智能体调度、每一次上下文注入。所有记录写入只追加(append-only)的Session Log,在Trajectory视图中可按来源逐条检查。
基于这套事件流,开发者可以执行四类操作:
这种级别的可观测性不仅是调试利器,更是进行严肃模型评测的前提。如果你要对比模型A和模型B在编码任务上的表现差异,你需要看到每个模型实际看到了什么、做了什么——而不仅仅是最终输出。Harness从设计层面保证了这一点。
2.4 多端形态全覆盖
同一套Harness底层,提供四种交互形态,覆盖全开发场景:
三、Cordis内核:一切皆插件的理论基石
3.1 从Koishi到通用元框架
Cordis(拉丁语意为"心")是一个元框架——即"用于构建框架的框架"。它不耦合任何具体业务领域,只专注于解决一个核心问题:如何让软件的各个组件可以安全地组合、热插拔,并在卸载时完整逆转其所有副作用。
Cordis最初从知名聊天机器人框架Koishi中抽离,作为底层插件系统独立发展。Koishi支持QQ、微信、飞书、Telegram等多平台,其核心设计哲学是"插件即一切"——所有功能通过插件实现且支持运行时热更新。随着这套插件系统逐渐成熟,开发者意识到它解决的依赖管理、生命周期控制、副作用追踪与回滚问题,是几乎所有复杂软件系统都会面临的共性挑战。于是Cordis被剥离为独立项目。
2026年8月,北京大学与DeepSeek-AI联合发表论文《A Programming Paradigm for Spatiotemporal Composability》,为Cordis的设计建立了形式化模型,将其核心理念概括为"时空可组合性"。Cordis的核心实现仅约2000行TypeScript代码,心智负担极低。
3.2 时空可组合性
Cordis的设计哲学浓缩为两个维度:
时间可组合性(Temporal Composability):任何组件在撤出时,必须能够完整逆转其产生的所有副作用。传统软件架构中,组件安装后往往难以干净卸载——注册的事件监听器、打开的文件句柄、修改的全局状态常常残留,导致内存泄漏、状态污染甚至系统崩溃。Cordis要求所有副作用操作都返回撤销函数,内部维护副作用栈,卸载时自动按逆序清理。
空间可组合性(Spatial Composability):任何组件必须显式声明其依赖的服务,系统据此自动编排加载顺序。当依赖关系发生变化时,系统自动调整相关组件的生命周期。这消除了隐式依赖带来的加载顺序错误和运行时崩溃风险。
简言之,系统既需要知道一个组件"做了什么"(时间维度——可逆),也需要知道它"需要什么"(空间维度——可组合)。两个维度共同作用,使得系统可以在长期运行中经历无数次组件增删改而保持一致性。
3.3 可逆效应机制
这是Cordis最独特的设计。所有副作用操作通过上下文注册,并返回一个撤销函数(disposer):
// 注册事件监听 — 返回disposer,卸载时自动调用
ctx.on('message', (session) => {
console.log('收到消息:', session.content)
})
// 注册自定义副作用 — 显式返回清理函数
ctx.effect(() => {
const conn = createDatabaseConnection(config)
return () => conn.close() // 返回disposer
})
// 事务化加载:配置更新时原子性加载
// 任何步骤失败则整体回滚,不会出现"装了一半"的残局
ctx.plugin(myPlugin, config)当插件被卸载或重载时,Cordis自动调用所有disposer,确保资源完全释放。配合事务化加载机制——配置更新时原子性地加载新配置,任何步骤失败则整体回滚——系统状态始终保持一致。
据Cordis团队分享,基于该框架构建的Koishi服务在三年间经历了无数次插件热更新,进程从未重启。这种"永不停机"的特性对于需要长期运行的Agent服务至关重要。
3.4 五大核心概念
使用Cordis需要理解五个核心概念:
inject属性和apply(ctx)方法的函数,也可以是继承自Service的类。所有Agent能力——模型、工具、技能、会话、沙箱、存储、循环、调度、UI——均为插件。ctx.tools、ctx.llm、ctx.database),提供统一命名空间,避免全局污染。inject声明所需服务,Cordis自动解析依赖图,确保服务按正确顺序加载:const myPlugin = {
inject: ['llm', 'tools'], // 声明依赖
apply(ctx) {
// 此时 ctx.llm 和 ctx.tools 已保证可用
ctx.llm.chat('请分析这段代码的性能瓶颈')
}
}ctx.on()注册,天然享受可逆副作用保障。四、实战:从零搭建你的第一个Harness智能体
4.1 快速启动
安装Node.js后,一行命令启动Web UI:
# 一键启动Web UI
npx @deepseek-ai/dsh web
# 或从源码克隆进行二次开发
git clone https://github.com/deepseek-ai/deepseek-harness
cd deepseek-harness
npm install
npm run dev4.2 配置自定义模型与工具链
Harness的"一切皆插件"理念意味着你可以替换任何组件。以下是通过配置文件指定模型提供商、工具集和执行策略的示例:
# dsh.config.yaml
plugins:
model:
provider: deepseek
model: deepseek-v4-pro
apiKey: ${DEEPSEEK_API_KEY}
reasoningEffort: max # 使用最大推理模式
temperature: 1.0
topP: 0.95
tools:
- file-editor # 文件读写与编辑
- shell # 终端命令执行
- web-search # 网页搜索
- str_replace_editor # 精确字符串替换
sandbox:
type: docker # Docker沙箱隔离
workdir: /workspace
loop:
strategy: reactive # 反应式循环策略
maxIterations: 50 # 最大迭代次数
retryOnFailure: true # 失败自动重试
storage:
type: local # 本地存储
path: ~/.dsh/sessions无需修改框架源码,仅通过配置即可完成模型、工具、沙箱、循环策略的全部定制。
4.3 编写自定义工具插件
开发者可以编写自己的工具插件并注册到Harness中。以下是一个数据库查询工具插件的完整示例:
import { Context, Service } from 'cordis'
// 定义数据库服务
class DatabaseService extends Service {
constructor(ctx: Context) {
super(ctx, 'database', true)
}
async query(sql: string) {
// 执行数据库查询并返回结果
const result = await this.execute(sql)
return result
}
private async execute(sql: string) {
// 实际查询逻辑...
}
}
// 注册工具插件
const databasePlugin = {
inject: ['tools'], // 依赖工具服务
apply(ctx: Context) {
// 注册为模型可调用的工具
ctx.tools.register('database_query', {
description: 'Execute a read-only SQL query on the project database',
parameters: {
sql: {
type: 'string',
description: 'The SQL statement to execute'
}
},
handler: async (args: { sql: string }) => {
const db = ctx.database
const rows = await db.query(args.sql)
return JSON.stringify(rows, null, 2)
}
})
}
}
export default databasePlugin4.4 多智能体协作配置
Harness支持主智能体自动拆解任务、分派子智能体并行工作。以下是一个典型的多智能体协作配置:
const projectConfig = {
mode: 'standard',
subagents: {
// 研究员:负责查阅文档和技术资料
researcher: {
description: '查找相关文档、API参考和技术资料',
tools: ['web-search', 'file-reader'],
model: 'deepseek-v4-pro',
reasoningEffort: 'think'
},
// 程序员:负责编写和修改代码
coder: {
description: '编写和修改源代码文件',
tools: ['file-editor', 'shell', 'str_replace_editor'],
model: 'deepseek-v4-pro',
reasoningEffort: 'max'
},
// 测试员:负责运行测试并验证结果
tester: {
description: '运行单元测试、集成测试并验证修复效果',
tools: ['shell', 'file-reader'],
model: 'deepseek-v4-flash',
reasoningEffort: 'think'
}
},
// 主智能体调度策略
orchestrator: {
maxParallelSubagents: 3,
summarizeStrategy: 'merge-and-review',
maxIterations: 20
}
}主节点会根据任务类型自动调度:研究员查阅文档、程序员修改代码、测试员运行验证,三者并行推进。主节点汇总各子智能体的结果,持续迭代直到任务完成。这种机制突破了传统一问一答的交互限制,支持数小时级别的超长连续任务。
五、正面宣战:Harness vs Claude Code vs Codex
5.1 三大框架横向对比
| 维度 | DeepSeek Harness | Claude Code | OpenAI Codex |
|---|---|---|---|
| 开源协议 | MIT(完全开源) | 闭源 | 闭源 |
| 模型绑定 | 任意OpenAI兼容模型 | 仅Claude系列 | 仅GPT系列 |
| 架构理念 | 一切皆插件 | 封闭集成 | 封闭集成 |
| 可定制性 | 极高(插件级替换) | 低 | 低 |
| 运行模式 | 4种预设 | 单一模式 | 单一模式 |
| 多智能体 | 原生支持 | 支持 | 支持 |
| 可追溯性 | 全链路Session Log | 有限 | 有限 |
| 私有化部署 | 完全支持 | 受限 | 受限 |
| 社区生态 | 开放插件市场 | 封闭 | 封闭 |
| 成本 | 约为Claude的1/30 | Anthropic定价 | OpenAI定价 |
5.2 差异化优势:可逆性与可组合性
Harness与Claude Code、Codex的根本区别在于"可逆性"和"可组合性"两个维度。
Claude Code和Codex都是封闭的成品工具——开发者使用它们,但不能修改它们的内部机制。如果模型需要更换、工具需要定制、循环策略需要调整,开发者要么接受既有设计,要么从头造轮子。
Harness将这种封闭性彻底打破。模型适配器、工具注册、Session Log、甚至驱动模型反复调用工具的Agent Loop本身,都只是可替换的插件。开发者无需修改框架源码,仅通过配置文件即可替换、新增、组合任意模块。
更激进的是,Harness的Creator模式允许Agent在运行时检查当前Cordis环境,临时定义、加载、卸载新组件。这意味着Agent不只是调用现有工具——它可以直接修改自己所处的运行时框架。
5.3 递归自我改进的雏形
这一设计直接指向一个前沿方向:递归自我改进。AI要持续改进自身,不一定需要先修改最具挑战性的模型权重。提示词、上下文、工具、工作流、甚至Agent Loop本身,都可以成为改进对象。Cordis将Harness从硬编码程序转变为一组可持续组合、替换、卸载的零件,DeepSeek甚至将运行时接口的操作权交给了Agent本身。
如果未来的递归自我改进从Harness而非模型权重开始,Cordis提供了关键基础:让模型、工具、上下文、Session乃至Agent Loop,从固定设计转变为可被机器重组的对象。这或许是这次发布中最具长期想象力的部分。
六、API调价与私有化部署的深层逻辑
6.1 价格调整预告
DeepSeek同步预告8月17日起上调云端API调用价格。这一时间节点选择颇有深意:恰好在V4-Pro权重开源和Harness发布之后,为开发者提供了完整的本地替代方案。
6.2 推动私有化部署
调价的战略意图清晰:推动企业加快私有化本地部署。V4-Pro权重以MIT协议开源,配合Harness的完整本地运行能力,企业可以在自有基础设施上构建完全可控的AI编程工作台,无需依赖云端API。
私有化部署的优势显而易见:
6.3 商业模式转变
这一策略反映出DeepSeek商业逻辑的深层转变:不再单纯依靠API调用收费,而是通过"开源模型+开源框架"建立生态护城河,将价值捕获从按量计费转向私有化部署服务、企业级支持、定制化开发等更高附加值的领域。当模型和框架都是开源的,竞争壁垒就从技术垄断转向生态规模和服务质量。
七、Vibe Coding全链路:从概念到工程闭环
7.1 Vibe Coding的起源与演进
2025年2月,Andrej Karpathy在X上提出"Vibe Coding"概念,描述了一种全新的编程范式:开发者用自然语言与AI交流,接受AI的建议,几乎不阅读生成的代码。他坦言自己会用最随意的方式提出需求,比如"把侧边栏的padding减小一半",因为懒得自己去找。这一概念迅速走红,获得超过450万次浏览,2025年11月被Collins词典评为年度词汇,Merriam-Webster也在2026年3月将其收入词条。
但Vibe Coding从概念到工程落地,始终缺少一个关键环节:一个能让AI真正进入项目环境、循环执行"读项目→改文件→跑终端→查报错→迭代修复"的运行框架。在此之前的AI编程工具,要么只能生成代码片段(需要人工复制粘贴),要么是封闭的成品工具(无法定制)。
7.2 全链路补齐
DeepSeek的V4-Pro + Harness组合,正是补齐了这最后一环,形成了完整的五层架构:
这五个层次构成了完整的Vibe Coding工程闭环,让"用自然语言指挥AI完成完整开发任务"从概念演示变为可重复的工程实践。
7.3 成本结构的改变
传统AI编程的成本主要集中在API调用上。以V4-Pro为例,虽然其API定价已远低于Claude和GPT系列(输入约为Claude Opus的1/8,输出约为1/21),但长期高频调用的累计成本依然可观。Harness的本地化部署能力改变了这一成本结构:企业部署本地GPU集群运行V4-Pro权重,配合Harness进行开发,单次推理的边际成本趋近于零。这在每日数百次迭代的场景下,具有显著的长期成本优势。
八、行业影响与未来展望
8.1 竞争赛道切换
V4-Pro + Harness的组合标志着AI编码竞争从"模型参数竞赛"切换到"执行层竞赛"。过去,大模型厂商的竞争焦点集中在参数规模、开源权重、API定价;而现在,模型与真实环境的执行层成为新战场。
OpenAI早已将Codex的本地调度层命名为Harness,推出桌面端多智能体和电脑操作能力。Anthropic的Claude Code主打本地代码工程交互。AI编码之所以成为智能体能力的最佳试验场,核心在于代码拥有客观、可自动化验证的反馈:编译报错、测试用例、终端日志能直接形成"执行-反馈-修正"闭环,持续训练智能体的规划、纠错和长任务处理能力。Harness掌控这套闭环的完整流程,让DeepSeek拥有了自研可控的智能体执行标准。
8.2 开源生态的催化效应
MIT协议开源意味着Harness可以被任何团队自由使用、修改和分发。配合开放的插件生态系统(GitHub dsh-plugin话题),这有望催生一个繁荣的社区生态:
截至8月14日,GitHub仓库已获2.75万星,社区插件生态正在快速生长。这个增长速度在开源AI工具中属于第一梯队。
8.3 未来路线展望
从DeepSeek的产品节奏可以窥见清晰的路线图:
结语
DeepSeek V4-Pro-0813权重开源与Harness框架发布,不是孤立的产品迭代,而是一次系统性的战略转向。从"提供强模型"到"提供能干活的智能体基础设施",DeepSeek正在重新定义自己在AI生态中的角色。
模型决定智能上限,Harness决定智能能否落地。当两者以MIT协议开源的形式交到全球开发者手中时,AI编程的竞争格局正在被改写。对于开发者而言,现在既有了一个在编程基准上顶尖的开源模型,又有了一个架构理念领先的开源智能体框架——Vibe Coding的全链路,终于在工程层面被打通。
而更深层的意义在于:Cordis的"时空可组合性"范式和"可逆效应"机制,为AI智能体从"执行预设指令"走向"持续自我改进"提供了理论基础和工程路径。如果这条路径被验证可行,它的影响将远超AI编程本身。
💬 评论区 (0)
暂无评论,快来抢沙发吧!