DeepSeek V4 深度评测:开源大模型的天花板,再次被自己刷新了
2026年4月24日,DeepSeek 悄然发布 V4 正式版,同步开源,MIT License。没有发布会,没有铺天盖地的营销,但整个 AI 圈在几小时内就沸腾了。当 benchmark 数据一个个跳出来的时候,很多人用了一个词——"降维打击"。
这不是 DeepSeek 第一次让人震惊。从 V2.5 到 R1,再到今天的 V4,这家团队似乎总是擅长在行业认为"差不多到头了"的时候,再掀翻一次桌子。
这篇文章,我想抛开冰冷的跑分表格,从一个开发者和 AI 从业者的视角,聊聊 DeepSeek V4 到底改变了什么,哪些是真正的突破,哪些还需要冷静看待。
一、基本盘:1.6T 参数,百万上下文,双旗舰出击
先说最核心的信息:DeepSeek V4 这次采用"双旗舰"策略——V4-Pro 和 V4-Flash 同时发布。
V4-Pro 是当仁不让的绝对主力,1.6T 总参数、49B 激活参数,属于典型的 MoE(混合专家)架构。384 路专家加 1 个共享专家,每个 token 只激活其中的 6 个。这意味着它在推理时的计算成本远远低于同等规模的稠密模型,而表达能力却可以匹敌更大的模型。预训练数据量达到了 33T Token,这个量级放在全球大模型竞速中也是第一梯队。
V4-Flash 则走的是轻量路线,284B 总参数、13B 激活,主打低延迟、低成本场景。但在能力上,它并不是一个"阉割版"——后面我会讲到,它的代码和数学能力依然相当强悍。
最让我意外的是上下文窗口:原生 100 万 token,全系标配。不是 Pro 独享,Flash 也支持。从 V3 时代的 128K 到 V4 的 1M,整整翻了 8 倍,而且不是靠裁剪或拼接实现的伪扩展,是架构层面原生支持的。
二、六大架构创新:每一项都值得单独写论文
如果说参数规模和数据量还属于"大力出奇迹"的范畴,那 V4 在架构层面的六项创新才是真正的硬核贡献。我在这里不打算罗列技术细节,而是聊聊它们意味着什么。
2.1 CSA + HCA 混合注意力机制
Transformer 的自注意力机制有一个经典痛点:计算复杂度随序列长度呈 O(n^2) 增长。这也是为什么大多数模型在长上下文处理上会捉襟见肘。DeepSeek V3 时期用 MLA(多头潜在注意力)做了压缩尝试,而 V4 则直接推出了 CSA(Compressed Sparse Attention)+ HCA(Hybrid Cross Attention)的混合方案。
简单理解,CSA 负责在保证信息完整性的前提下压缩注意力矩阵,HCA 则在不同层级之间做跨注意力融合。两者的配合使得 1M token 的处理不再是理论可行,而是工程上真正高效的。这从后面长上下文 benchmark 的成绩就能看出端倪。
2.2 mHC 流形约束超连接
训练万亿级参数模型,稳定性是头号难题。梯度爆炸、损失波动、训练发散……每一个都可能让几个月的训练成果付诸东流。mHC(Manifold-Constrained Hyperconnection)的核心思想是在超连接(Hyperconnection)层面引入流形约束,让参数更新始终在一个合理的几何空间内进行。
这不是一个炫技式的创新,而是一个解决实际痛点的工程突破。它的价值在于让 DeepSeek 敢于把模型推到 1.6T 这个规模,而不需要时刻担心训练崩溃。
2.3 Muon 优化器
Muon 是近年来学术界关注度很高的新型优化器,但在万亿参数级别的实际训练中采用它,DeepSeek 是第一家。传统的 AdamW 在大模型训练中已经验证了多年,替换它需要极大的勇气。Muon 在某些数学性质上优于 AdamW,理论上能提供更好的收敛特性,但此前没有人证明过它在超大规模训练中的鲁棒性。
V4 的成功训练本身就是 Muon 优化器可行性的最强背书。如果后续其他团队跟进验证,这可能会改变大模型训练的默认配置。
2.4 MoE 架构升级与 FP4 量化感知训练
MoE 部分的改进主要集中在路由策略上——如何更智能地把 token 分配给最合适的专家,避免"专家塌缩"(所有 token 都涌向少数几个专家)。V4 在这方面做了实质性改进,虽然具体方案尚未完全公开,但从效果来看,专家利用率明显提升。
FP4 量化感知训练同样值得关注。4-bit 浮点量化的精度损失理论上比 8-bit 大很多,但通过在训练阶段就引入量化模拟,让模型学会"适应"低精度,V4 实现了 FP4+FP8 混合精度下的几乎无损推理。这对部署成本的影响是巨大的。
2.5 后训练流程创新
V4 的后训练采用了 SFT → GRPO → 专家化 → 蒸馏 的四阶段管线。GRPO(Group Relative Policy Optimization)是 DeepSeek 在 R1 时期提出的强化学习方案,V4 进一步将其与专家化微调和蒸馏结合,形成了一套完整的能力提炼流程。这也解释了为什么 V4 既有强大的通用能力,又能通过蒸馏将能力传递给更小的 Flash 模型。
三、核心能力评测:数据会说话
Benchmark 只是数字,但数字背后的趋势值得关注。
3.1 数学与推理
MATH-500 96.1%、AIME 2024 99.4%、IMO-AnswerBench 89.8%——这些数字意味着什么?MATH-500 是高中到大学竞赛级别的数学题,96.1% 的准确率已经接近甚至超过大多数人类竞赛选手的水平。AIME 2024 是美国数学邀请赛,99.4% 的准确率几乎等同于"全对"。IMO-AnswerBench 则触及了国际数学奥林匹克级别的问题,89.8% 的成绩虽然还不是满分,但已经是 AI 模型的历史最佳之一。
这个水平的数学能力,已经不是"辅助解题"的概念了,而是具备了独立探索和发现数学证明路线的潜力。
3.2 代码能力:真正的杀手锏
LiveCodeBench Pass@1 达到 93.5%,在全球 120 个参评模型中排名第 1。Codeforces Rating 3206,排名第 2。
这两个数据放在一起看更有意思。LiveCodeBench 测试的是一次性写对代码的能力(Pass@1),93.5% 意味着它第一次生成的代码就有极高的正确率。Codeforces 是真实的编程竞赛平台,3206 的 rating 相当于人类中的高手水平。
代码能力是 DeepSeek V4 最突出的标签,甚至超越了许多专门的代码模型。对于开发者来说,这意味着在实际的编程辅助场景中,V4 的体验提升会是立竿见影的。
3.3 知识理解
MMLU Pro 87.5%、GPQA Diamond 90.1%。前者覆盖 57 个学科的大学级问题,后者则是由博士级专家出题的专家知识测试。90%+ 的 GPQA Diamond 成绩说明 V4 在深层专业知识上的理解已经相当扎实,不再局限于"知道答案",而是真正理解了背后的逻辑。
3.4 Agent 与长上下文
Terminal-Bench 67.9% 和 BrowseComp 83.4% 展示了 V4 作为 AI Agent 的能力——它能自主操作终端、浏览网页并完成任务。
长上下文方面,MRCR 测试达到 83.5 MMR,超过了 Gemini-3.1-Pro 的 76.3。这意味着在处理超长文档(比如几十万字的技术文档、完整的代码仓库、长篇法律合同)时,V4 不仅能"看到"所有内容,还能精准地在百万 token 中定位和提取信息。
四、与 V3 / R1 的区别:不只是"更大更强"
很多人会问:V4 相比 V3,到底变了什么?
最直观的变化是规模的跃升:671B → 1.6T 总参数,128K → 1M 上下文窗口。但深层次的变化远不止于此。
注意力机制从 MLA 演进到 CSA+HCA,这不仅是性能的提升,更是架构范式的切换。MLA 是在传统注意力框架内做压缩,而 CSA+HCA 是重新设计了注意力的计算方式。
优化器从 AdamW 切换到 Muon,这在工程上是一个巨大的赌注,但结果证明赌对了。
另一个容易被忽视但意义重大的变化是:首次全面适配华为昇腾算力。这意味着 DeepSeek V4 不再只能跑在 NVIDIA GPU 上,为国产算力生态提供了真正可用的顶级大模型选项。
与 R1 的关系则更微妙。R1 是 DeepSeek 在推理增强路线上的探索,而 V4 更像是在通用能力上的全面整合。V4 的后训练管线中继承了 R1 的 GRPO 方案,可以理解为 R1 的推理增强能力已经被"内化"到了 V4 中。
五、竞品对比:代码最强,性价比碾压
在代码能力上,DeepSeek V4 已经超越了 GPT-5.4 和 Gemini-3.1-Pro,处于全球第一梯队甚至第一的位置。这是一个里程碑——中国的开源模型在代码这个关键维度上登顶,在一年前几乎是不可想象的。
在知识、推理等综合维度上,V4 与 GPT-5.4、Claude Opus 4.6 等顶级闭源模型各有胜负。坦率地说,在最顶级的深度推理(比如超长链推理、极端复杂的逻辑博弈)上,V4 与 Claude Opus 4.6 仍有一定差距。但这个差距正在快速缩小。
真正拉开差距的是性价比。V4-Flash 的定价为 $0.28 / M token,而 GPT-4o 的价格大约是 $11.2 / M token——差了整整 40 倍。而且 V4 是 MIT License 开源,你可以自由地下载、修改、部署,没有任何限制。这意味着对于有自建需求的团队来说,V4 几乎没有使用门槛。
六、实际使用体验
说了这么多数据,实际用起来是什么感觉?
百万上下文是真实可用的。 我测试了几个典型场景:一次性投入一本约 40 万字的技术书籍,让 V4 根据全书内容生成结构化笔记和知识图谱;投入一个包含上百个文件的中型代码仓库,让它理解整体架构并回答具体的实现细节问题。在两种场景下,V4 都表现出了可靠的信息检索和关联能力,没有出现明显的"遗忘"或"幻觉"。
代码实战体感出色。 我用 V4 完成了几个真实的编程任务:从零实现一个小型 Web 框架、修复一个复杂的并发 Bug、将一段 Python 代码重构为 Rust。在"第一次生成就能用"这个维度上,V4 的表现确实优于我之前使用的大多数模型。特别是 Codeforces Rating 3206 这个水平反映在实战中,就是它在面对算法密集型任务时给出的方案质量非常高。
长文档 + 联网融合的场景是一个亮点。 V4 在处理需要结合上下文理解和实时信息的任务时(比如"根据这份财报全文,结合最新市场数据,分析这个公司的投资价值"),展现出了流畅的多模态信息整合能力。
七、性价比分析:开源免费,但要算总账
V4 采用 MIT License 开源,这意味着:
但"开源免费"不等于"零成本"。1.6T 参数的模型,全量推理需要大量的 GPU/昇腾资源。即便是 MoE 架构只激活 49B,在自建部署时仍然需要专业的推理优化(vLLM、TensorRT-LLM 等)和足够的基础设施。对于没有 GPU 集群的小团队,通过 API 调用可能是更务实的选择。
好在 DeepSeek 的 API 定价确实厚道。V4-Flash $0.28/M token 的价格,即使对于高频率的生产环境调用,成本也完全可以忽略不计。V4-Pro 的价格虽然高一些,但相比同等能力的闭源模型仍然是数量级的优势。
八、总结:开源模型的里程碑
DeepSeek V4 不是完美的模型。在最顶尖的深度推理上它还不是毫无争议的第一,它的 MoE 架构也意味着部署门槛比小模型更高。但如果你问我在 2026 年中,哪个模型最能代表 AI 行业的"技术普惠"精神,我的答案一定是 DeepSeek V4。
它在代码能力上全球登顶,在数学推理上逼近人类专家水平,在长上下文处理上实现了百万 token 的原生支持——然后以开源 MIT 的方式免费给了全世界。这已经不是"性价比"能形容的了,这是一种对行业格局的重塑。
从 V2 到 V3,从 R1 到 V4,DeepSeek 的迭代节奏之快、进步幅度之大,让人不得不重新思考一个问题:开源模型到底能不能追上甚至超越闭源模型?V4 的回答是,不仅能追上,在某些维度上还能反超。
对于开发者来说,这是一个值得拥抱的模型。对于整个行业来说,这是一个值得研究的案例。
DeepSeek V4 的最大贡献,也许不是它本身有多强,而是它证明了开源路线的天花板还远未到来。
💬 评论区 (0)
暂无评论,快来抢沙发吧!