引言:小模型逆袭的新高度
2026年7月31日,DeepSeek在没有任何预热的情况下,悄然发布了V4-Flash正式版。这个发布动作本身就很"DeepSeek"——不开发布会,不请媒体,甚至在发布后24小时内官网都没有更新。但技术圈的反应却异常热烈:一个仅13B活跃参数的模型,在Agent任务基准测试中全面超越了1.6T参数的旗舰模型V4-Pro,而且全部是通过后训练实现的,没有改变任何架构。
这意味着什么?简单来说,DeepSeek向业界证明了一个颠覆性的观点:模型架构的比拼正在接近天花板,后训练(Post-Training)才是真正决定模型能力的护城河。
V4-Flash技术规格一览
首先,让我们通过一张表格了解V4-Flash的核心技术参数:
| 参数项 | V4-Flash | V4-Pro | V4 |
|--------|----------|--------|-----|
| 总参数量 | 284B | 1.6T | 671B |
| 活跃参数量 | 13B | 32B | 37B |
| 专家数量 | 256 | 128 | 256 |
| 每次激活专家数 | 8 | 8 | 8 |
| 上下文长度 | 128K | 128K | 128K |
| 支持语言 | 多语言 | 多语言 | 多语言 |
| 输入价格($/M tokens) | 0.02 | 0.15 | 0.07 |
| 输出价格($/M tokens) | 0.14 | 0.60 | 0.28 |
| 推理速度(tokens/s) | 200+ | 80+ | 120+ |
| 架构 | MoE + MLA | MoE + MLA | MoE + MLA |
从表格中可以看出,V4-Flash的活跃参数量仅为V4-Pro的40%,但价格却只有后者的四分之一左右。更重要的是,它在Agent任务上的表现甚至超越了V4-Pro。
Agent基准测试:小模型的惊人表现
Agent能力是衡量一个模型"实用性"的核心指标。与传统的问答任务不同,Agent任务要求模型能够:
DeepSeek官方公布的基准测试结果令人震惊:
| 基准测试 | V4-Flash | V4-Pro | V3 | GPT-4o | Claude 3.5 Sonnet |
|----------|----------|--------|-----|--------|-------------------|
| SWE-bench Verified | 48.2% | 42.1% | 28.7% | 38.5% | 45.6% |
| SWE-bench Multilingual | 41.5% | 36.8% | 22.1% | 32.0% | 38.2% |
| Aider Polyglot | 68.3% | 57.9% | 42.5% | 55.0% | 62.1% |
| Berkeley Function Calling | 92.7% | 90.4% | 85.2% | 88.5% | 90.1% |
| GAIA | 64.3% | 58.7% | 45.0% | 52.5% | 60.8% |
| WebArena | 41.2% | 35.8% | 22.0% | 28.5% | 35.0% |
V4-Flash以13B活跃参数,在SWE-bench上超越了Claude 3.5 Sonnet和V4-Pro,在函数调用和GAIA上也展现了顶级的Agent能力。
后训练的秘密:SFT创新
V4-Flash的成功,核心在于其后训练策略的创新。DeepSeek在后训练阶段采用了三个关键策略:
1. 合成数据流水线
传统的SFT(监督微调)依赖人工标注数据,成本高、覆盖范围有限。DeepSeek构建了一套多层次的合成数据流水线:
这套流水线的核心思想是:用大模型生成数据来训练小模型,但生成的数据必须经过严格的质量控制和多样性增强。
2. 多轮对话训练
Agent任务的一个关键特性是多轮交互。传统的SFT数据通常是单轮的,无法训练模型在多轮对话中保持上下文和任务连贯性。DeepSeek专门构建了多轮Agent对话数据:
3. 执行反馈
这是DeepSeek最具创新性的策略之一。在执行反馈(Execution Feedback)中,模型生成的代码或工具调用会在真实的沙箱环境中执行,执行结果(成功/失败、错误信息、输出结果)会作为额外的训练信号反馈给模型。
这种策略的威力在于,它将"静态"的代码生成训练变成了"动态"的交互式学习:
# 传统的SFT:模型生成代码,不看执行结果
prompt = "编写一个Python函数,计算斐波那契数列的第n项"
response = model.generate(prompt)
# 训练信号:模型输出 vs 参考答案
# 执行反馈SFT:模型生成代码,执行后看结果
prompt = "编写一个Python函数,计算斐波那契数列的第n项"
response = model.generate(prompt)
try:
exec(response) # 实际执行代码
result = test_fibonacci(response) # 运行测试
# 训练信号:模型输出 + 执行结果(成功/失败/错误信息)
except Exception as e:
# 训练信号:模型输出 + 错误信息RL创新:从PRM到DPO
除了SFT,DeepSeek在强化学习阶段也做了大量创新。
过程奖励模型(PRM)
传统的RLHF使用结果奖励模型(ORM),只对最终结果进行评分。但Agent任务往往是多步的,只奖励最终结果会导致模型在中间步骤走捷径。
DeepSeek开发了过程奖励模型(PRM),对推理或执行的每一步都进行评分:
# 过程奖励模型伪代码
class ProcessRewardModel:
def score_step(self, step_input, step_output, context):
'''
对单个步骤进行评分
返回0-1之间的分数
'''
features = self.extract_features(step_input, step_output, context)
score = self.model.predict(features)
return score
def score_trajectory(self, steps):
'''
对整个执行轨迹进行评分
返回每个步骤的分数列表
'''
scores = []
context = []
for step in steps:
score = self.score_step(step.input, step.output, context)
scores.append(score)
context.append(step)
return scoresPRM能够识别出哪些步骤是"好的推理",哪些步骤是"走了弯路",从而提供更细粒度的训练信号。
DPO与RLHF的结合
DeepSeek在RL阶段同时使用了DPO(Direct Preference Optimization)和传统RLHF:
这种组合策略的优势在于:DPO训练效率高,快速建立基础行为模式;RLHF+PRM虽然计算成本更高,但能在Agent任务上实现精细化的能力提升。
推理时优化:思考模式与reasoning_effort
V4-Flash在推理时也引入了多项优化:
思考模式(Thinking Mode)
V4-Flash支持"思考模式",在回答复杂问题前会进行内部推理:
import requests
API_KEY = "your-api-key"
API_BASE = "https://api.deepseek.com/v1"
def chat_with_thinking(prompt):
'''使用思考模式调用DeepSeek V4-Flash'''
headers = {
"Authorization": f"Bearer {API_KEY}",
"Content-Type": "application/json"
}
payload = {
"model": "deepseek-v4-flash",
"messages": [
{"role": "user", "content": prompt}
],
"thinking": {
"type": "enabled",
"reasoning_effort": "high"
},
"temperature": 0.1
}
response = requests.post(
f"{API_BASE}/chat/completions",
headers=headers,
json=payload
)
result = response.json()
# 提取思考过程和最终回答
if "thinking" in result["choices"][0]["message"]:
thinking = result["choices"][0]["message"]["thinking"]
print(f"思考过程: {thinking}")
answer = result["choices"][0]["message"]["content"]
return answer
# 使用示例
result = chat_with_thinking(
"有三个盒子,一个装有两个金币,一个装有两个银币,"
"一个装有一个金币和一个银币。你随机选了一个盒子,"
"从中随机取出一个硬币,发现是金币。"
"请问这个盒子另一个硬币也是金币的概率是多少?"
)
print(f"最终回答: {result}")reasoning_effort参数
reasoning_effort是一个新颖的参数,控制模型在推理时的"思考深度":
| 参数值 | 适用场景 | 推理时间 | Token消耗 |
|--------|----------|----------|-----------|
| low | 简单对话、信息检索 | 短 | 少 |
| medium | 一般推理、代码编写 | 中 | 中 |
| high | 复杂推理、数学证明 | 长 | 多 |
这个参数让开发者可以根据任务复杂度灵活调整推理资源,在成本和效果之间取得平衡。
函数调用实战:构建Agent应用
V4-Flash在函数调用方面表现卓越。下面是一个完整的Agent应用示例:
import requests
import json
from datetime import datetime
API_KEY = "your-api-key"
API_BASE = "https://api.deepseek.com/v1"
# 定义工具函数
TOOLS = [
{
"type": "function",
"function": {
"name": "search_web",
"description": "搜索互联网获取最新信息",
"parameters": {
"type": "object",
"properties": {
"query": {
"type": "string",
"description": "搜索关键词"
},
"num_results": {
"type": "integer",
"description": "返回结果数量",
"default": 5
}
},
"required": ["query"]
}
}
},
{
"type": "function",
"function": {
"name": "calculate",
"description": "执行数学计算",
"parameters": {
"type": "object",
"properties": {
"expression": {
"type": "string",
"description": "数学表达式,如 '2 + 3 * 4'"
}
},
"required": ["expression"]
}
}
},
{
"type": "function",
"function": {
"name": "get_current_time",
"description": "获取当前日期和时间",
"parameters": {
"type": "object",
"properties": {
"timezone": {
"type": "string",
"description": "时区,如 'Asia/Shanghai'",
"default": "UTC"
}
}
}
}
}
]
def execute_tool(tool_name, arguments):
'''执行工具函数'''
if tool_name == "search_web":
# 模拟搜索
return json.dumps({
"results": [
{"title": "结果1", "snippet": f"关于 {arguments['query']} 的最新信息"},
{"title": "结果2", "snippet": f"{arguments['query']} 的详细分析"}
]
}, ensure_ascii=False)
elif tool_name == "calculate":
try:
result = eval(arguments["expression"])
return json.dumps({"result": result})
except Exception as e:
return json.dumps({"error": str(e)})
elif tool_name == "get_current_time":
return json.dumps({"time": datetime.now().isoformat()})
return json.dumps({"error": "Unknown tool"})
def agent_loop(user_query):
'''Agent主循环'''
headers = {
"Authorization": f"Bearer {API_KEY}",
"Content-Type": "application/json"
}
messages = [{"role": "user", "content": user_query}]
max_iterations = 10
for i in range(max_iterations):
payload = {
"model": "deepseek-v4-flash",
"messages": messages,
"tools": TOOLS,
"temperature": 0.1
}
response = requests.post(
f"{API_BASE}/chat/completions",
headers=headers,
json=payload
).json()
message = response["choices"][0]["message"]
messages.append(message)
# 检查是否有工具调用
if message.get("tool_calls"):
for tool_call in message["tool_calls"]:
tool_name = tool_call["function"]["name"]
arguments = json.loads(tool_call["function"]["arguments"])
print(f"[Agent] 调用工具: {tool_name}({arguments})")
result = execute_tool(tool_name, arguments)
messages.append({
"role": "tool",
"tool_call_id": tool_call["id"],
"content": result
})
else:
# 没有工具调用,返回最终回答
return message["content"]
return "Agent达到最大迭代次数,未能完成任务。"
# 使用示例
result = agent_loop(
"请帮我搜索2026年AI领域的最新进展,"
"然后用计算器算一下 (365 + 240) * 3.14 的结果,"
"最后告诉我当前时间。"
)
print(f"
最终回答: {result}")成本分析:极致性价比
V4-Flash的定价策略极具竞争力。下面将V4-Flash与主流模型进行成本对比:
| 模型 | 输入价格 | 输出价格 | 活跃参数 | Agent能力 |
|------|----------|----------|----------|-----------|
| DeepSeek V4-Flash | $0.02/M | $0.14/M | 13B | 顶级 |
| DeepSeek V4 | $0.07/M | $0.28/M | 37B | 顶级 |
| GPT-4o | $2.50/M | $10.00/M | 未公开 | 顶级 |
| Claude 3.5 Sonnet | $3.00/M | $15.00/M | 未公开 | 顶级 |
| Gemini 2.5 Pro | $0.50/M | $2.00/M | 未公开 | 强 |
| Llama 4 405B (自托管) | N/A | N/A | 405B | 强 |
以处理100万次Agent任务调用(平均每次消耗5000 tokens)为例:
V4-Flash的成本仅为GPT-4o的1.4%,Claude的0.9%。这种极致的性价比,使得大规模Agent应用在经济上变得可行。
总结与展望
DeepSeek V4-Flash的发布,带来了几个重要的行业启示:
展望未来,我们可以期待V4-Flash的进一步迭代,也期待更多团队借鉴DeepSeek的后训练策略,推动整个AI生态的进步。
本文技术分析基于DeepSeek官方发布的论文和文档,价格数据截至2026年8月。
💬 评论区 (0)
暂无评论,快来抢沙发吧!