DeepSeek V4 Pro全量上线:从模型到Agent框架的全面进化

2026年8月13日,国内大模型厂商DeepSeek一次性放出了两枚"重磅炸弹":在模型层面,DeepSeek V4 Pro正式版全量上线;在智能体框架层面,DeepSeek Harness v0.1以MIT协议开放源码。这两件事看似独立,实则构成了同一条战略主线——DeepSeek不再只是一家"卖模型、卖API"的公司,而是希望把"模型 + Agent运行时"作为一个完整闭环交付给开发者。

此前,DeepSeek主要通过模型权重、应用产品和API接口三种方式进入开发者工作流;而随着Harness的发布,DeepSeek第一次拥有了自己官方维护的通用Agent框架。业内普遍认为,这一举动是直接对标Anthropic的Claude Code能力。本文将从模型能力、Agent框架设计、工作流变革、代码实践和生态对比五个维度,对这次更新进行系统性解读。

DeepSeek V4 Pro:模型能力全面解析

核心参数与架构升级

DeepSeek V4 Pro(模型标识符为 DeepSeek-V4-Pro-0813)延续并强化了DeepSeek一贯的混合专家(Mixture of Experts, MoE)架构路线。其总参数量达到约1.6万亿规模,而每个token的激活参数约为490亿,由6个专家网络被路由激活。这种"大模型总参、小激活量"的稀疏设计,使得模型在保持极高知识容量的同时,把单次推理的计算成本压缩到可控区间。

在权重发布层面,V4 Pro选择了MIT协议,这是目前开源大模型中最宽松的协议之一,意味着商业使用几乎没有限制。权重格式采用 safetensors,主体权重以FP8精度存储,而专家权重进一步采用FP4精度(NVFP4格式),这种混合精度策略大幅降低了显存占用与存储成本,使超大模型在有限硬件上的本地部署成为可能。

下面是V4 Pro正式版的核心规格速览:

| 维度 | 参数值 |
| --- | --- |
| 架构 | 稀疏MoE |
| 总参数量 | 约1.6万亿 |
| 单token激活参数 | 约490亿(6专家路由) |
| 上下文窗口 | 1,048,576 tokens(1M) |
| 最大输出长度 | 384,000 tokens |
| 权重协议 | MIT |
| 权重格式 | safetensors,FP8(专家权重FP4) |
| 本版本新增 | DSpark投机解码模块 |

1M上下文窗口的意义

上下文长度直接决定了模型一次能"记住"多少信息。V4 Pro提供高达1M(约104万)token的上下文窗口,并支持最大38.4万token的输出,这两项指标叠加,使得"长文档分析 + 超长代码生成 + 多轮复杂任务"可以在单次会话内完成。

对开发者而言,1M上下文窗口意味着:

  • 整仓代码理解:可以把一个中型项目的全部源码塞进上下文,让模型在跨文件重构、依赖梳理时不再"失忆"。

  • 长文档处理:财报、法律合同、科研论文合集等动辄数十万token的材料,可一次性喂入并做结构化总结。

  • Agent长程任务:Agent在执行多步骤任务时会产生大量中间观察(observation)和工具调用记录,超长上下文是支撑其"长记忆"的物理基础。
  • 第三方推理服务方Novita已率先支持 DeepSeek-V4-Pro-0813,并提供1M上下文窗口,开发者无需自行部署数百GB权重,即可通过API调用这一超长上下文能力。

    推理与代码生成能力提升

    V4 Pro在官方定位中明确将"推理、代码生成和智能体工作流"作为三大优化场景。从公开评测看,该模型在LiveCodeBench上取得了93.5的Pass@1成绩,Codeforces Rating达到3206,两项均为所有被评估模型(含闭源旗舰API)中的第一。

    这种代码能力的跃升,结合前述1M上下文,使V4 Pro天然适合作为Agent工作流的"大脑"。原因在于:Agent工作流本质上是"理解任务 → 规划步骤 → 调用工具 → 解析结果 → 修正方案"的循环,每一步都强依赖模型的推理与代码生成能力。V4 Pro的另一个技术亮点是引入了DSpark投机解码模块,配合原生MTP(Multi-Token Prediction,多token预测)机制,可在推理时一次预测多个候选token,从而在不损失精度的前提下显著提升解码速度。

    值得一提的是,llama.cpp社区也在第一时间跟进,新增了 llama serve 命令并支持V4系列的NextN/MTP投机解码。相关PR显示,该实现在Qwen3.6-27B上已验证可实现约2.2倍的解码加速,这为本地部署V4系列模型提供了性能保障。

    Harness v0.1:开源Agent框架深度解读

    什么是Agent框架

    要理解Harness的价值,首先要厘清"模型"与"Agent"的关系。一个裸模型只是一个"输入文本、输出文本"的函数;而真正能干活儿的Agent,还需要一整套运行时系统来支撑:它要能记住上下文、能调用外部工具(执行代码、读写文件、访问网络)、能在多步骤间维护状态、能在出错时自我修正。这套"模型外面的运行系统",就是Agent框架(Agent Harness)。

    可以用一个简洁的公式概括DeepSeek这次的产品逻辑:

    Model + Harness = Agent

    模型决定"智商上限",框架决定"能力边界与稳定性"。Anthropic的Claude Code、OpenAI的Codex CLI,本质上都是各家自己维护的Agent Harness。DeepSeek此前缺的,正是这一层官方运行时。

    Harness的设计理念与架构

    DeepSeek Harness(社区简称 dsh)目前以开发者预览版形式发布,源码托管在GitHub的 deepseek-ai/deepseek-harness 仓库,采用MIT协议。项目README开宗明义地提出了核心理念——"一切皆插件"(everything is a plugin)。这意味着Agent运行时的几乎每个组成部分都可以被替换:

  • 推理层:可切换不同的模型后端;

  • 工具注册表:可动态挂载文件I/O、Shell、Git、网络检索等工具;

  • 会话状态:可插拔的上下文与记忆存储;

  • Agent控制循环:可自定义规划—执行—反思的循环逻辑;

  • 执行环境:可配置沙箱、权限边界与运行隔离。
  • 据公开资料,Harness采用名为"Cordis"的模块化架构来落地这套插件化理念。由于其极强的可替换性,社区已将其称为"Agent界的Android"——正如Android通过分层架构让硬件厂商可替换驱动与应用,Harness让开发者可以为不同场景定制每一层运行时。

    MIT协议开源的意义

    Harness选择MIT协议而非 restrictive 许可,这一点值得单独强调。MIT是业内最宽松的开源协议之一,几乎不附加使用、修改、分发的限制,特别适合以下几类场景:

  • 企业内网集成:可将其嵌入商业产品而无需开源衍生代码;

  • 二次开发:团队可fork出私有分支,定制符合自身安全合规要求的Agent;

  • 生态共建:降低了第三方贡献插件、工具与控制循环的门槛。
  • 开源首日,该仓库Star数即突破8万,超过xAI的Grok-1积攒一年多的量,足见社区对"开源通用Agent框架"的渴求。

    与Claude Code、OpenAI Codex的对比

    把Harness放回行业坐标系中,能与它对标的是Anthropic的Claude Code(含Cowork)和OpenAI的Codex CLI。三者都是"模型厂商自研的通用Agent Harness",但策略差异明显。

    | 维目 | DeepSeek Harness | Anthropic Claude Code | OpenAI Codex CLI |
    | --- | --- | --- | --- |
    | 发布时间 | 2026年8月 | 2025年2月 | 2025年4月 |
    | 开源协议 | MIT(完全开放) | 闭源 | Apache-2.0 |
    | 模型绑定 | 默认V4,可替换 | 仅限Claude | 支持云端与本地模型 |
    | 架构理念 | 一切皆插件(Cordis) | 垂直整合 | Rust + OS沙箱 |
    | 部署灵活性 | 极高(可私有化、可换模型) | 低(绑定Anthropic云) | 中(支持本地模型) |

    可以看出,Harness的差异化优势在于"开源 + 插件化 + 模型可替换"的组合,这是Claude Code的闭源垂直整合路线所不具备的。换言之,DeepSeek选择把"Agent运行时"也变成开放基础设施,而非锁死在自家云服务上。

    从模型到Agent:工作流变革

    传统API调用 vs Agent工作流

    在Harness出现之前,开发者调用DeepSeek的方式以"单轮或简单多轮API调用"为主:拼一个prompt,拿到一段文本,再做后处理。这种模式适合问答、翻译、摘要等"一锤子买卖"任务,但在面对"帮我调研某技术并写一份对比报告"这类需要规划、检索、分析、迭代的复杂任务时,就显得力不从心。

    Agent工作流的本质区别在于引入了"循环 + 工具 + 状态":

  • 循环:模型不是一次性回答,而是在"思考—行动—观察"的循环中推进任务;

  • 工具:模型可以主动调用计算、检索、执行代码等工具来获取外部信息;

  • 状态:跨步骤维护任务上下文、中间结果与计划,而不是每轮从零开始。
  • 从"调API"到"跑Agent",开发者的关注点也从"如何写好prompt"转向"如何设计工具集、控制循环与任务分解策略"。

    多智能体协作模式

    当任务足够复杂时,单个Agent往往难以兼顾所有环节。Harness的插件化设计天然支持多智能体协作:可以让一个Agent负责规划(拆解任务),另一个Agent负责执行(调用工具),第三个Agent负责评审(校验结果)。这种"规划—执行—评审"的三角结构,是工业界验证过的可靠协作范式。

    多智能体协作的关键挑战在于:

  • 任务边界:每个Agent的职责要清晰,避免重复劳动或互相干扰;

  • 通信契约:Agent之间需要约定结构化的消息格式,以便机器解析;

  • 失败隔离:单个Agent出错不应拖垮整个流程,需要可重试与降级机制。
  • 任务委派与模型选择

    在多Agent体系中,"任务委派"还隐含着"模型选择"的维度。并非所有步骤都需要最贵最强的模型:简单格式化、分类判断可以交给小模型,而复杂推理、架构设计才需要V4 Pro这样的旗舰模型。Harness的可替换推理层,使得开发者可以按步骤动态切换模型,在效果与成本之间取得平衡。这种"按需选模"的能力,是单模型API调用时代所不具备的。

    实战:构建DeepSeek Agent应用

    环境搭建

    下面以Python为例,演示如何调用DeepSeek V4 Pro的API。假设你已通过DeepSeek官方或Novita等服务方获取了API Key。

    python
    # 安装依赖:pip install openai
    # DeepSeek API 兼容 OpenAI 接口规范,可直接复用 openai SDK
    
    import os
    from openai import OpenAI
    
    # 通过环境变量注入 API Key,避免硬编码
    client = OpenAI(
        api_key=os.getenv("DEEPSEEK_API_KEY"),
        base_url="https://api.deepseek.com/v1",  # 也可换为 Novita 等兼容端点
    )
    
    def chat(prompt: str, model: str = "deepseek-v4-pro-0813") -> str:
        """调用 DeepSeek V4 Pro 完成单轮对话"""
        resp = client.chat.completions.create(
            model=model,
            messages=[{"role": "user", "content": prompt}],
            # V4 Pro 支持超长上下文与输出,可按需调大
            max_tokens=4096,
            temperature=0.3,
        )
        return resp.choices[0].message.content
    
    if __name__ == "__main__":
        answer = chat("用三句话解释 MoE 架构为什么能降低推理成本。")
        print(answer)

    使用DeepSeek-TUI终端工具

    对于偏好命令行的开发者,社区项目 DeepSeek-TUI 提供了一套终端内的编码智能体体验。该项目由 Hmbown 发起,使用 Rust + ratatui 编写,专为 DeepSeek V4 系列设计,在 GitHub 已收获约31k Star。

    它将流式LLM对话与完整的工具执行层结合,支持文件读写、Shell执行、Git操作、GitHub集成、LSP诊断以及MCP服务器接入,并默认兼容任何 OpenAI 协议的模型服务。安装方式有二:

    bash
    # 方式一:npm 全局安装(跨平台,最快捷)
    npm install -g deepseek-tui
    
    # 方式二:Cargo 安装(推荐 Rust 开发者)
    cargo install deepseek-tui --locked
    
    # 首次启动会提示输入 DeepSeek API Key
    # Key 会保存到 ~/.deepseek/config.toml,之后任意目录均可直接使用
    deepseek-tui
    
    # 也可提前用子命令完成鉴权配置
    deepseek auth

    DeepSeek-TUI 提供三种运行模式以匹配不同的可控性需求:监督模式(supervised,每步需人工确认)、先规划模式(plan-first,先输出计划再执行)、全自动模式(fully autonomous,全程自主执行)。在Linux/macOS上还提供内核级沙箱隔离,保证工具执行的安全边界。

    Harness框架快速上手

    Harness(dsh)以MIT协议开源后,开发者可直接从GitHub获取并定制。其"一切皆插件"的理念体现在配置驱动上——你无需改动框架核心,只需声明使用的推理后端、工具集与控制循环。以下是一个概念性的快速上手示例(基于开发者预览版的插件式配置思路):

    python
    # 安装:pip install deepseek-harness  (社区包名以仓库实际为准)
    # 或从源码:git clone https://github.com/deepseek-ai/deepseek-harness
    
    from deepseek_harness import Harness, tools
    
    # 1) 配置推理后端(可替换为任意 OpenAI 兼容端点)
    agent = Harness(
        model="deepseek-v4-pro-0813",
        api_key_env="DEEPSEEK_API_KEY",
        base_url="https://api.deepseek.com/v1",
    )
    
    # 2) 注册工具插件(体现"一切皆插件"——可自由增删)
    agent.register(tools.file_read)      # 读取文件
    agent.register(tools.file_write)     # 写入文件
    agent.register(tools.shell)          # 执行 Shell 命令
    agent.register(tools.web_search)     # 网络检索
    
    # 3) 设定 Agent 控制循环策略(监督 / 先规划 / 全自动)
    agent.set_mode("plan-first")
    
    # 4) 启动任务
    result = agent.run("分析当前目录下的 Python 依赖,找出版本冲突并给出修复建议。")
    print(result.summary)

    构建多步骤Agent工作流

    当你需要更细粒度的控制时,可以基于Harness的能力手动编排一个多步骤Agent工作流。下面演示一个"规划—执行—评审"三段式工作流的Python实现思路:

    python
    import os, json
    from openai import OpenAI
    from deepseek_harness import Harness, tools
    
    client = OpenAI(
        api_key=os.getenv("DEEPSEEK_API_KEY"),
        base_url="https://api.deepseek.com/v1",
    )
    
    # 规划Agent:负责拆解任务,输出结构化步骤
    def planner(goal: str) -> list[str]:
        prompt = (
            f"你是一名项目规划师。请把以下目标拆解为3-5个可执行步骤,"
            f"用JSON数组返回,每个元素是一句简短指令:
    目标:{goal}"
        )
        resp = client.chat.completions.create(
            model="deepseek-v4-pro-0813",
            messages=[{"role": "user", "content": prompt}],
            response_format={"type": "json_object"},
        )
        return json.loads(resp.choices[0].message.content)["steps"]
    
    # 执行Agent:携带工具,逐步执行
    def executor(steps: list[str]) -> list[str]:
        agent = Harness(model="deepseek-v4-pro-0813",
                        api_key_env="DEEPSEEK_API_KEY")
        agent.register(tools.shell)
        agent.register(tools.file_read)
        agent.set_mode("supervised")  # 每步需确认,更安全
        results = []
        for step in steps:
            results.append(agent.run(step).summary)
        return results
    
    # 评审Agent:对执行结果做质量校验
    def reviewer(goal: str, results: list[str]) -> str:
        prompt = (
            f"你是质量评审。请判断以下执行结果是否达成原始目标,并给出改进建议。
    "
            f"目标:{goal}
    结果:{json.dumps(results, ensure_ascii=False)}"
        )
        resp = client.chat.completions.create(
            model="deepseek-v4-pro-0813",
            messages=[{"role": "user", "content": prompt}],
        )
        return resp.choices[0].message.content
    
    if __name__ == "__main__":
        goal = "为现有Python项目补全单元测试,使覆盖率从40%提升至80%"
        steps = planner(goal)          # 1. 规划
        outputs = executor(steps)     # 2. 执行
        feedback = reviewer(goal, outputs)  # 3. 评审
        print("评审反馈:", feedback)

    上述代码勾勒了多Agent协作的骨架:规划Agent负责"想清楚",执行Agent借助Harness的工具层负责"做出来",评审Agent负责"把好关"。三个角色可分别挂载不同强度的模型,实现按需选模、降本增效。

    生态对比:DeepSeek vs Anthropic vs OpenAI

    Agent能力对比表

    从模型到Agent,三家厂商的生态布局各有侧重。下表从多个维度做横向对比:

    | 对比维度 | DeepSeek | Anthropic | OpenAI |
    | --- | --- | --- | --- |
    | 旗舰模型 | V4 Pro(MoE,1.6T参数) | Claude(闭源) | GPT系列(闭源) |
    | Agent框架 | Harness v0.1(MIT开源) | Claude Code(闭源) | Codex CLI(Apache-2.0) |
    | 上下文窗口 | 1M tokens | 长上下文(具体以官方为准) | 长上下文 |
    | 模型可替换性 | 高(插件化推理层) | 低(绑定Claude) | 中(支持本地模型) |
    | 本地部署 | 支持(权重MIT开源,FP8/FP4) | 不支持 | 部分支持 |
    | 社区终端工具 | DeepSeek-TUI(Rust,31k+ Star) | 官方为主 | 官方为主 |

    开源策略对比

    三家在开源策略上呈现明显梯度:

  • DeepSeek:模型权重与Agent框架均以MIT协议开源,开放程度最高;

  • OpenAI:Codex CLI以Apache-2.0开源,但旗舰模型权重闭源;

  • Anthropic:模型与Agent框架均闭源,走垂直整合路线。
  • DeepSeek的双开源(模型 + 框架)策略,本质上是把基础设施层彻底开放,用社区生态对冲闭源厂商的整合优势。这种打法在Android历史上已被验证有效。

    成本与部署灵活性

    成本与部署灵活性是企业落地的关键考量。DeepSeek V4 Pro在API层面采用cache-miss的输入/输出定价(参考约 $0.435 / $0.87 每百万token,并以高峰/低峰分时定价),同时由于权重MIT开源,企业可选择自建推理(结合llama.cpp的MTP投机解码、vLLM等方案)来进一步压低成本。相比之下,闭源厂商只能走云API一条路,定价与可用性都受制于人。

    在部署灵活性上,DeepSeek的"云API + 本地权重 + 开源框架"三选项模式,使企业能根据数据合规、延迟、成本的不同要求灵活取舍,这是单一闭源路线难以匹敌的。

    未来展望

    DeepSeek V4 Pro与Harness的组合,标志着一个新阶段的开启:大模型竞争的焦点,正从"单一模型分数"转向"模型 + Agent框架 + 生态"的体系化对抗。

    可以预见几个趋势:

  • Agent框架成为基础设施:正如操作系统之于应用,Agent Harness将成为上层AI应用的默认底座,而开源框架有望建立事实标准;

  • 多模型混用常态化:插件化推理层让"按步骤选模"成为工程常规,企业将按任务难度动态调度不同模型;

  • 社区插件生态爆发:MIT协议下,围绕工具、控制循环、记忆与安全沙箱的第三方插件将快速涌现;

  • 本地部署门槛持续下降:FP8/FP4权重 + MTP投机解码 + llama.cpp/vLLM等推理引擎的协同优化,会让超大模型的本地方案日益成熟。
  • 对开发者而言,现在的关键不是"选哪个模型最强",而是"理解Model + Harness = Agent这一新范式,并学会在插件化的运行时上构建自己的工作流"。DeepSeek这次把模型和框架同时开源,等于把这张入场券以最低门槛递给了整个社区。能否跑出下一个"Agent界的超级应用",就看接下来生态如何在这块开放地基上生长了。

    💬 评论区 (0)

    暂无评论,快来抢沙发吧!