AI基准测试的饱和危机:当分数超过90%之后我们该思考什么

2026年8月,Claude Opus 5在MMLU-Pro上拿到94.1%,Claude Sonnet 5、DeepSeek V4-Pro、Qwen3.8-Max同月越过90%线,SWE-bench Verified的头部成绩已逼近96%。当几乎所有前沿模型都在同一份"试卷"上考出90分以上,一个新的问题浮出水面——基准测试正在饱和,而用来区分模型优劣的"标尺"正在失去刻度。

这并非危言耸听。MMLU-Pro的设计初衷是拉开模型差距,但当头部模型集体站上90%线,剩下的不到10分空间,已不足以刻画真实世界里千差万别的任务难度。本文回顾基准测试的进化路径,剖析当前饱和现状的方法论根源,并探讨当分数趋同时,应当如何重新定义"模型能力"。

基准测试的进化史:从MMLU到MMLU-Pro

要理解今天的饱和危机,需要回到基准测试的演进脉络。2020年问世的MMLU(Massive Multitask Language Understanding)覆盖57个学科、近16,000道选择题,一度成为衡量模型"知识广度"的事实标准。随着模型规模与训练数据增长,MMLU的区分度迅速下降——到2023年,头部模型已接近89%,选择题形式与部分可猜测性使其天花板过早显现。

为此,研究界在2024年推出MMLU-Pro:将学科扩展到更细粒度,把题型从纯选择题升级为"选择题加自由作答"的混合形式,并显著增加需要多步推理的题目比例,题量约12,000道但难度更集中。MMLU-Pro把天花板从89%拉到94%以上,给模型留出了新的爬升空间。

然而仅仅两年过去,MMLU-Pro也走到类似MMLU的临界点。Claude Opus 5的94.1%距离满分只剩不到6分,而标准层的Claude Sonnet 5(91.8%)与DeepSeek V4-Pro(91.0%)已紧贴90%线。进化史给出的启示是:基准测试的"有效期"正在缩短——MMLU用了约3年走向饱和,MMLU-Pro只用了2年。

当前基准测试的饱和现状

2026年8月,Claude Opus 5以94.1%触及MMLU-Pro榜首,其下方的标准层已有多款模型越过90%线,SWE-bench Verified的头部成绩则逼近96%。把主要模型的MMLU-Pro得分放在一起,饱和趋势一目了然。下面的柱状图标注了90%饱和线,可以清晰看到多个模型已挤在线之上或线附近。


主要模型 MMLU-Pro 得分与 90% 饱和线
虚线为 90% 饱和线|数据来源:各厂商官方发布(2026年8月)

Claude Opus 5

94.1%

GPT-5.6 Sol v2

93.2%

Gemini 3.1 Pro

92.5%

Claude Sonnet 5

91.8%

DeepSeek V4-Pro

91.0%

Qwen3.8-Max

90.5%

Kimi K3

89.2%

GLM 5.2

87.8%

Gemini 3.5 Flash

86.2%

DeepSeek V4-Flash

82.4%


90% 饱和线

图:主要模型MMLU-Pro得分与90%饱和线。90%线以上聚集了前沿层与标准层,模型间分差已从早期的两位数缩小到2-3个百分点;当一份试卷上90%的考生都考到90分以上,这份试卷的选拔价值便大幅衰减。

为什么高分不等于高能力

高分与高能力之间之所以出现"脱钩",根源在于基准测试与真实任务的分布差异。MMLU-Pro的题目虽增加了推理成分,仍以"单轮、封闭、有标准答案"为底色,而真实世界的AI应用场景往往"多轮、开放、目标模糊"。

具体而言,Claude Sonnet 5(91.8%)与Claude Opus 5(94.1%)的2.3分差距,在公开榜单上看似不小,映射到真实业务中,只对2-3%的极复杂任务产生可观测影响。对绝大多数生产任务——客服路由、文档摘要、代码补全、数据抽取——标准层的能力已经触顶。榜单上那最后的5-6分,买的是越来越稀薄的边际能力。

更关键的是,真实任务的难度并不呈均匀分布。一个企业80%的工作可能落在"标准层足以胜任"的区间,只有顶部10-20%的复杂任务才需要前沿层介入。选型时若只盯榜单总分,就会为那2-3%的边际任务支付4-7倍的溢价,造成显著的资源错配。

一个更隐蔽的脱钩来自"正确性与稳健性的分离"。基准测试只奖励答对,不惩罚答错的方式——一个在MMLU-Pro上拿90分的模型,可能在长文本抽取中以95%的置信度给出一个幻觉引用,而基准不会考察这种"高置信错误"。在生产中,这类错误往往比"诚实地说不知道"代价更高:它伪装成可信结论,绕过人工复核进入下游决策。把基准分数等同于"可信度",会系统性高估模型在风险场景下的可靠性。

基准测试的方法论缺陷

现有基准测试存在几处结构性缺陷,静态题库的脆弱性首当其冲。无论MMLU-Pro还是SWE-bench,题目集合一旦公开,就难以避免被纳入训练数据的命运。即便设置"Verified"子集进行人工核验,也无法完全排除数据污染,导致分数被系统性高估。

第二是单轮评估与多轮现实的错位。基准测试多采用"一次提问、一次回答"的范式,但真实的Agent系统依赖长程多轮交互、工具调用与状态记忆。一个在单轮MMLU-Pro上拿94分的模型,未必能在20轮工具调用后仍保持稳定,而后者才是生产环境的核心能力。

第三是缺乏对抗性。现有基准以"合作性"题目为主,模型只需尽力作答即可得分;但在安全关键的部署中,模型需要识别提示注入、对抗性指令与越狱企图,这类能力在常规基准中几乎未被考察。

第四是领域覆盖的偏差。MMLU-Pro虽覆盖多学科,但权重偏向通用知识,对医疗、法律、金融建模等垂直行业的深度刻画有限,导致"通用高分"无法外推为"专业高分"。

第五是评测成本与覆盖的权衡。全面的人工评测昂贵且不可扩展,自动化评测又受限于"裁判模型"自身的能力天花板——当被评模型已逼近或超过裁判模型,分数信噪比急剧下降。这种"裁判能力上限"使得顶级模型的横向对比愈发依赖稀缺的人类专家判断,进一步推高评估成本,也拉长了新模型的独立验证周期。

新兴评估方向:真实世界任务、对抗性测试、多轮对话

评估范式的迁移已成必然,重心正从"做对题"转向"做成事",三个方向正在成为新前沿。

真实世界任务评估强调用端到端业务流程代替孤立题目。与其问"这段代码有何bug",不如让模型在一个真实仓库中完成"复现issue、定位、修复、跑测试、提PR"的全链路,并以可验证的工程产出(测试是否通过、PR是否合并)作为评分依据。SWE-bench的进化方向正是如此,但其覆盖的仓库与任务类型仍需大幅扩展。

对抗性测试关注模型在恶意输入下的鲁棒性。通过红队自动化生成提示注入、越狱与社会工程攻击,评估模型"拒绝不当请求"与"保持对齐"的能力。这类评估无法用一个总分概括,需要给出"在不同攻击强度下的失败率曲线"。

多轮对话评估关注长程一致性。可参考的实践是构造包含工具调用、状态变更与中途纠错的多轮场景,评估模型在10-50轮交互后是否仍能维持目标对齐、记忆一致与指令遵循。下面是一段简化的多轮一致性测试脚手架。

python
def evaluate_multi_turn(model, scenario):
    # 在多轮工具调用场景中评估模型的一致性与状态保持能力。
    history, score = [], 0
    for step in scenario.steps:
        response = model.act(step.user_msg, history, tools=step.tools)
        # 是否在需要时调用了正确的工具
        if response.uses_tool(step.expected_tool):
            score += 1
        # 遇到中途纠错时能否基于历史状态自适应
        if step.is_correction and response.adapts_prior_state:
            score += 1
        history.append((step.user_msg, response))
    consistency = score / len(scenario.steps)
    return {"consistency": consistency, "drift": detect_drift(history)}


def detect_drift(history):
    # 检测多轮对话后模型是否偏离最初目标。
    initial_goal = history[0][0]
    last_answer = history[-1][1]
    return not last_answer.aligned_with(initial_goal)

这类评估的输出不再是单一百分比,而是一组"在何种任务分布与对抗强度下的表现曲线",更贴近真实部署。

还有一类方向聚焦"能力边界测绘"。不再追求一个总分,而是系统性地寻找模型失效的临界条件——在多长上下文后开始遗忘、在多复杂的工具链后开始错乱、在多强的对抗提示下被越狱。输出的是一张"失效等高线图",明确告诉部署方模型在哪些区域可信、哪些区域必须加人工护栏。这种从"打分"到"测绘"的转变,比单一百分比更贴近工程部署的实际需求。

对开发者的实际启示

对一线开发者而言,基准饱和带来的直接启示是:别再只看榜单选模型。当MMLU-Pro越过90%后,公开分数对生产选型的指导价值急剧下降,开发者应转而建立"业务专属"的评估闭环。

具体做法是:从自家业务中抽取100-300条代表性样本,覆盖不同难度与领域,用统一的Prompt与评测脚本对候选模型打分;记录每个模型在"任务难度分布"上的胜率,而非单一总分。同时把价格纳入评分函数——在能力差距小于3个百分点时,单位成本往往才是决定性的维度,这正是$2/1M tokens成为标准层甜蜜点的根本原因。

在评估工具上,可优先采用"分层评测":用成本优化层模型做粗筛与大批量打分,再用人类专家或最强前沿层对争议样本做复核,既控制成本又保证关键决策的可信度。这种"低成本裁判加专家复核"的两段式,比一刀切的全人工或全自动评测更适配真实工程的预算约束。

此外,开发者应警惕"发布疲劳"。8月20天内11个模型的密集发布,极易导致注意力碎片化与无意义的频繁迁移。务实的策略是:只在当前模型连续两个评测周期落后于新发布、且差距对业务可观测时,才启动迁移评估,把每次迁移的2-3个工程日预算花在真正有价值的地方。

2027年评估趋势预测

展望2027年,AI评估体系有望出现三重转变。静态题库将让位于动态评估——基于真实代码仓库、真实API与真实业务流程的"活体基准"将成为主流,题目集合随时间演化以避免污染。单一总分将让位于能力雷达图——评估输出将是一组按"推理深度、长程一致性、对抗鲁棒性、领域专业度、成本效率"分维度的曲线,而非一个笼统百分比。人类参与将让位于自动化裁判——由强模型担任"裁判模型"(LLM-as-judge)配合可验证沙箱执行,实现大规模、可重复的自动化评估。

与此同时,基准的"有效期"会进一步缩短,评估本身可能演化为一种持续运行的基础设施,而非阶段性的发布仪式。这对评估工具链的可扩展性与抗污染能力提出更高要求,也将催生独立的第三方评估服务赛道。

另一条值得关注的线索是评估标准的开放化。当各厂商自报分数难以互信,行业需要中立的、版本化的公开评测协议,让不同团队能在同一套任务集合与同一套打分脚本上复现结果。这类协议一旦形成共识,会像容器镜像标准那样降低模型间的对比摩擦,把"谁的分数更高"的争论收敛为"在同一协议下谁能复现"的工程问题。

总结

当所有模型都考90分以上,基准测试的"区分功能"便走向饱和。这并非模型发展的终点,而是评估范式重启的起点。MMLU-Pro在两年内从"拉开差距"走向"再次趋同",提醒我们:任何静态试卷都有保质期,而真实世界的任务复杂度远比选择题深邃。

对开发者与企业,破局之道在于回归业务本身——用真实任务、对抗性测试与多轮一致性替代单一榜单分数,让选型决策建立在与自身场景匹配的"能力曲线"之上。当分数不再能区分高下,能在洪流中保持理性、用专属评测锚定真实价值的人,才会在AI的下半场真正胜出。

💬 评论区 (0)

暂无评论,快来抢沙发吧!