DeepSeek V4-Flash正式版深度评测:13B小模型打趴1.6T旗舰,后训练才是真正的护城河

引言:小模型逆袭的新高度

2026年7月31日,DeepSeek在没有任何预热的情况下,悄然发布了V4-Flash正式版。这个发布动作本身就很"DeepSeek"——不开发布会,不请媒体,甚至在发布后24小时内官网都没有更新。但技术圈的反应却异常热烈:一个仅13B活跃参数的模型,在Agent任务基准测试中全面超越了1.6T参数的旗舰模型V4-Pro,而且全部是通过后训练实现的,没有改变任何架构。

这意味着什么?简单来说,DeepSeek向业界证明了一个颠覆性的观点:模型架构的比拼正在接近天花板,后训练(Post-Training)才是真正决定模型能力的护城河。

V4-Flash技术规格一览

首先,让我们通过一张表格了解V4-Flash的核心技术参数:

| 参数项 | V4-Flash | V4-Pro | V4 |
|--------|----------|--------|-----|
| 总参数量 | 284B | 1.6T | 671B |
| 活跃参数量 | 13B | 32B | 37B |
| 专家数量 | 256 | 128 | 256 |
| 每次激活专家数 | 8 | 8 | 8 |
| 上下文长度 | 128K | 128K | 128K |
| 支持语言 | 多语言 | 多语言 | 多语言 |
| 输入价格($/M tokens) | 0.02 | 0.15 | 0.07 |
| 输出价格($/M tokens) | 0.14 | 0.60 | 0.28 |
| 推理速度(tokens/s) | 200+ | 80+ | 120+ |
| 架构 | MoE + MLA | MoE + MLA | MoE + MLA |

从表格中可以看出,V4-Flash的活跃参数量仅为V4-Pro的40%,但价格却只有后者的四分之一左右。更重要的是,它在Agent任务上的表现甚至超越了V4-Pro。

Agent基准测试:小模型的惊人表现

Agent能力是衡量一个模型"实用性"的核心指标。与传统的问答任务不同,Agent任务要求模型能够:

  • 理解复杂的多步指令

  • 使用工具(函数调用)

  • 在多轮交互中保持上下文

  • 处理错误并自我修正
  • DeepSeek官方公布的基准测试结果令人震惊:

    | 基准测试 | V4-Flash | V4-Pro | V3 | GPT-4o | Claude 3.5 Sonnet |
    |----------|----------|--------|-----|--------|-------------------|
    | SWE-bench Verified | 48.2% | 42.1% | 28.7% | 38.5% | 45.6% |
    | SWE-bench Multilingual | 41.5% | 36.8% | 22.1% | 32.0% | 38.2% |
    | Aider Polyglot | 68.3% | 57.9% | 42.5% | 55.0% | 62.1% |
    | Berkeley Function Calling | 92.7% | 90.4% | 85.2% | 88.5% | 90.1% |
    | GAIA | 64.3% | 58.7% | 45.0% | 52.5% | 60.8% |
    | WebArena | 41.2% | 35.8% | 22.0% | 28.5% | 35.0% |

    V4-Flash以13B活跃参数,在SWE-bench上超越了Claude 3.5 Sonnet和V4-Pro,在函数调用和GAIA上也展现了顶级的Agent能力。

    后训练的秘密:SFT创新

    V4-Flash的成功,核心在于其后训练策略的创新。DeepSeek在后训练阶段采用了三个关键策略:

    1. 合成数据流水线

    传统的SFT(监督微调)依赖人工标注数据,成本高、覆盖范围有限。DeepSeek构建了一套多层次的合成数据流水线:

  • 种子数据生成:使用V4-Pro作为教师模型,生成初步的训练样本

  • 多样性增强:通过改写、重组、对抗性扰动等方式,确保数据覆盖更广泛的场景

  • 质量过滤:使用多个评判模型对生成数据进行打分,只保留高质量样本

  • 困难度分级:根据任务难度对数据进行分级,确保模型在训练过程中逐步提升
  • 这套流水线的核心思想是:用大模型生成数据来训练小模型,但生成的数据必须经过严格的质量控制和多样性增强。

    2. 多轮对话训练

    Agent任务的一个关键特性是多轮交互。传统的SFT数据通常是单轮的,无法训练模型在多轮对话中保持上下文和任务连贯性。DeepSeek专门构建了多轮Agent对话数据:

  • 模拟真实的Agent工作流程:用户提问 -> Agent分析 -> 调用工具 -> 获取结果 -> 分析结果 -> 继续调用工具 -> 最终回答

  • 包含错误处理和修正:在训练数据中故意引入错误,让模型学会如何从错误中恢复

  • 包含工具调用失败场景:模拟工具返回错误、超时、异常等情况,训练模型的鲁棒性
  • 3. 执行反馈

    这是DeepSeek最具创新性的策略之一。在执行反馈(Execution Feedback)中,模型生成的代码或工具调用会在真实的沙箱环境中执行,执行结果(成功/失败、错误信息、输出结果)会作为额外的训练信号反馈给模型。

    这种策略的威力在于,它将"静态"的代码生成训练变成了"动态"的交互式学习:

    python
    # 传统的SFT:模型生成代码,不看执行结果
    prompt = "编写一个Python函数,计算斐波那契数列的第n项"
    response = model.generate(prompt)
    # 训练信号:模型输出 vs 参考答案
    
    # 执行反馈SFT:模型生成代码,执行后看结果
    prompt = "编写一个Python函数,计算斐波那契数列的第n项"
    response = model.generate(prompt)
    try:
        exec(response)  # 实际执行代码
        result = test_fibonacci(response)  # 运行测试
        # 训练信号:模型输出 + 执行结果(成功/失败/错误信息)
    except Exception as e:
        # 训练信号:模型输出 + 错误信息

    RL创新:从PRM到DPO

    除了SFT,DeepSeek在强化学习阶段也做了大量创新。

    过程奖励模型(PRM)

    传统的RLHF使用结果奖励模型(ORM),只对最终结果进行评分。但Agent任务往往是多步的,只奖励最终结果会导致模型在中间步骤走捷径。

    DeepSeek开发了过程奖励模型(PRM),对推理或执行的每一步都进行评分:

    python
    # 过程奖励模型伪代码
    class ProcessRewardModel:
        def score_step(self, step_input, step_output, context):
            '''
            对单个步骤进行评分
            返回0-1之间的分数
            '''
            features = self.extract_features(step_input, step_output, context)
            score = self.model.predict(features)
            return score
        
        def score_trajectory(self, steps):
            '''
            对整个执行轨迹进行评分
            返回每个步骤的分数列表
            '''
            scores = []
            context = []
            for step in steps:
                score = self.score_step(step.input, step.output, context)
                scores.append(score)
                context.append(step)
            return scores

    PRM能够识别出哪些步骤是"好的推理",哪些步骤是"走了弯路",从而提供更细粒度的训练信号。

    DPO与RLHF的结合

    DeepSeek在RL阶段同时使用了DPO(Direct Preference Optimization)和传统RLHF:

  • DPO:用于快速对齐,让模型在基础行为上符合人类偏好

  • RLHF + PRM:用于精细调优,特别是在Agent任务上提升多步推理能力
  • 这种组合策略的优势在于:DPO训练效率高,快速建立基础行为模式;RLHF+PRM虽然计算成本更高,但能在Agent任务上实现精细化的能力提升。

    推理时优化:思考模式与reasoning_effort

    V4-Flash在推理时也引入了多项优化:

    思考模式(Thinking Mode)

    V4-Flash支持"思考模式",在回答复杂问题前会进行内部推理:

    python
    import requests
    
    API_KEY = "your-api-key"
    API_BASE = "https://api.deepseek.com/v1"
    
    def chat_with_thinking(prompt):
        '''使用思考模式调用DeepSeek V4-Flash'''
        headers = {
            "Authorization": f"Bearer {API_KEY}",
            "Content-Type": "application/json"
        }
        
        payload = {
            "model": "deepseek-v4-flash",
            "messages": [
                {"role": "user", "content": prompt}
            ],
            "thinking": {
                "type": "enabled",
                "reasoning_effort": "high"
            },
            "temperature": 0.1
        }
        
        response = requests.post(
            f"{API_BASE}/chat/completions",
            headers=headers,
            json=payload
        )
        
        result = response.json()
        
        # 提取思考过程和最终回答
        if "thinking" in result["choices"][0]["message"]:
            thinking = result["choices"][0]["message"]["thinking"]
            print(f"思考过程: {thinking}")
        
        answer = result["choices"][0]["message"]["content"]
        return answer
    
    # 使用示例
    result = chat_with_thinking(
        "有三个盒子,一个装有两个金币,一个装有两个银币,"
        "一个装有一个金币和一个银币。你随机选了一个盒子,"
        "从中随机取出一个硬币,发现是金币。"
        "请问这个盒子另一个硬币也是金币的概率是多少?"
    )
    print(f"最终回答: {result}")

    reasoning_effort参数

    reasoning_effort是一个新颖的参数,控制模型在推理时的"思考深度":

    | 参数值 | 适用场景 | 推理时间 | Token消耗 |
    |--------|----------|----------|-----------|
    | low | 简单对话、信息检索 | 短 | 少 |
    | medium | 一般推理、代码编写 | 中 | 中 |
    | high | 复杂推理、数学证明 | 长 | 多 |

    这个参数让开发者可以根据任务复杂度灵活调整推理资源,在成本和效果之间取得平衡。

    函数调用实战:构建Agent应用

    V4-Flash在函数调用方面表现卓越。下面是一个完整的Agent应用示例:

    python
    import requests
    import json
    from datetime import datetime
    
    API_KEY = "your-api-key"
    API_BASE = "https://api.deepseek.com/v1"
    
    # 定义工具函数
    TOOLS = [
        {
            "type": "function",
            "function": {
                "name": "search_web",
                "description": "搜索互联网获取最新信息",
                "parameters": {
                    "type": "object",
                    "properties": {
                        "query": {
                            "type": "string",
                            "description": "搜索关键词"
                        },
                        "num_results": {
                            "type": "integer",
                            "description": "返回结果数量",
                            "default": 5
                        }
                    },
                    "required": ["query"]
                }
            }
        },
        {
            "type": "function",
            "function": {
                "name": "calculate",
                "description": "执行数学计算",
                "parameters": {
                    "type": "object",
                    "properties": {
                        "expression": {
                            "type": "string",
                            "description": "数学表达式,如 '2 + 3 * 4'"
                        }
                    },
                    "required": ["expression"]
                }
            }
        },
        {
            "type": "function",
            "function": {
                "name": "get_current_time",
                "description": "获取当前日期和时间",
                "parameters": {
                    "type": "object",
                    "properties": {
                        "timezone": {
                            "type": "string",
                            "description": "时区,如 'Asia/Shanghai'",
                            "default": "UTC"
                        }
                    }
                }
            }
        }
    ]
    
    def execute_tool(tool_name, arguments):
        '''执行工具函数'''
        if tool_name == "search_web":
            # 模拟搜索
            return json.dumps({
                "results": [
                    {"title": "结果1", "snippet": f"关于 {arguments['query']} 的最新信息"},
                    {"title": "结果2", "snippet": f"{arguments['query']} 的详细分析"}
                ]
            }, ensure_ascii=False)
        elif tool_name == "calculate":
            try:
                result = eval(arguments["expression"])
                return json.dumps({"result": result})
            except Exception as e:
                return json.dumps({"error": str(e)})
        elif tool_name == "get_current_time":
            return json.dumps({"time": datetime.now().isoformat()})
        return json.dumps({"error": "Unknown tool"})
    
    def agent_loop(user_query):
        '''Agent主循环'''
        headers = {
            "Authorization": f"Bearer {API_KEY}",
            "Content-Type": "application/json"
        }
        
        messages = [{"role": "user", "content": user_query}]
        max_iterations = 10
        
        for i in range(max_iterations):
            payload = {
                "model": "deepseek-v4-flash",
                "messages": messages,
                "tools": TOOLS,
                "temperature": 0.1
            }
            
            response = requests.post(
                f"{API_BASE}/chat/completions",
                headers=headers,
                json=payload
            ).json()
            
            message = response["choices"][0]["message"]
            messages.append(message)
            
            # 检查是否有工具调用
            if message.get("tool_calls"):
                for tool_call in message["tool_calls"]:
                    tool_name = tool_call["function"]["name"]
                    arguments = json.loads(tool_call["function"]["arguments"])
                    
                    print(f"[Agent] 调用工具: {tool_name}({arguments})")
                    
                    result = execute_tool(tool_name, arguments)
                    
                    messages.append({
                        "role": "tool",
                        "tool_call_id": tool_call["id"],
                        "content": result
                    })
            else:
                # 没有工具调用,返回最终回答
                return message["content"]
        
        return "Agent达到最大迭代次数,未能完成任务。"
    
    # 使用示例
    result = agent_loop(
        "请帮我搜索2026年AI领域的最新进展,"
        "然后用计算器算一下 (365 + 240) * 3.14 的结果,"
        "最后告诉我当前时间。"
    )
    print(f"
    最终回答: {result}")

    成本分析:极致性价比

    V4-Flash的定价策略极具竞争力。下面将V4-Flash与主流模型进行成本对比:

    | 模型 | 输入价格 | 输出价格 | 活跃参数 | Agent能力 |
    |------|----------|----------|----------|-----------|
    | DeepSeek V4-Flash | $0.02/M | $0.14/M | 13B | 顶级 |
    | DeepSeek V4 | $0.07/M | $0.28/M | 37B | 顶级 |
    | GPT-4o | $2.50/M | $10.00/M | 未公开 | 顶级 |
    | Claude 3.5 Sonnet | $3.00/M | $15.00/M | 未公开 | 顶级 |
    | Gemini 2.5 Pro | $0.50/M | $2.00/M | 未公开 | 强 |
    | Llama 4 405B (自托管) | N/A | N/A | 405B | 强 |

    以处理100万次Agent任务调用(平均每次消耗5000 tokens)为例:

  • V4-Flash:100万 x 5000 x $0.14/1000000 = $700

  • GPT-4o:100万 x 5000 x $10.00/1000000 = $50,000

  • Claude 3.5 Sonnet:100万 x 5000 x $15.00/1000000 = $75,000
  • V4-Flash的成本仅为GPT-4o的1.4%,Claude的0.9%。这种极致的性价比,使得大规模Agent应用在经济上变得可行。

    总结与展望

    DeepSeek V4-Flash的发布,带来了几个重要的行业启示:

  • 后训练比预训练更重要:在模型架构趋于稳定的背景下,后训练的质量和创新能力才是真正决定模型能力的因素。V4-Flash通过创新的SFT和RL策略,让13B活跃参数的小模型在Agent任务上超越了1.6T参数的旗舰模型。

  • 小模型也能有大能力:通过精心设计的后训练,小模型可以在特定任务上达到甚至超越大模型的表现。这对降低AI应用成本、推动AI普及具有重要意义。

  • 开源生态的力量:DeepSeek坚持开源策略,让整个社区都能受益于其技术创新。这种模式正在改变AI产业的竞争格局。

  • Agent能力是下一个战场:随着基础模型能力趋于同质化,Agent能力(工具使用、多步推理、自我修正)成为差异化竞争的关键。
  • 展望未来,我们可以期待V4-Flash的进一步迭代,也期待更多团队借鉴DeepSeek的后训练策略,推动整个AI生态的进步。


    本文技术分析基于DeepSeek官方发布的论文和文档,价格数据截至2026年8月。

    💬 评论区 (0)

    暂无评论,快来抢沙发吧!