没有官方成绩单的2.4万亿参数怪兽:Qwen 3.8 真的能打吗?

没有官方成绩单的2.4万亿参数怪兽:Qwen 3.8 真的能打吗?

阿里在2026年7月19日悄无声息地放出了通义千问3.8-Max-Preview。没有发布会,没有Benchmark白皮书,甚至连权重都还没开源。但就在这种"裸奔"状态下,它已经在第三方评测中杀到了全球前十。这到底是一个什么样的模型?

一、先看家底:2.4万亿参数的MoE巨兽

Qwen 3.8 采用了MoE(Mixture of Experts)混合专家架构,总参数量达到惊人的2.4万亿。但MoE的核心优势在于——每次推理只激活其中一小部分专家网络,所以实际推理成本远没有"2.4万亿"听起来那么吓人。

上下文方面,标准配置为128K token,但官方表示可以扩展至1M token。这意味着它可以一次性处理大约75万字的中文文本,对于长文档分析、大规模代码仓库理解等场景来说,这是一个非常关键的能力。

多模态能力是原生集成的,不是后期拼接。文本、图片、视频、文档——四种模态共享同一个底层模型,理论上可以做到真正的跨模态理解和推理,而不是每种模态各跑一个模型再拼接结果。

另一个值得关注的架构设计是双推理机制:思考模式(Deep Thinking)和快速模式(Fast Mode)。简单来说,面对复杂问题可以让模型"想一会儿"再回答,而简单问题则可以快速给出响应。这种设计在Claude和GPT系列中也有类似实现,但Qwen 3.8将其作为核心架构特性来强调,说明阿里在这方面的工程投入不小。

二、核心能力:哪些地方真正让人眼前一亮?

结构化拆解能力

这是我看完所有实测报告后印象最深的点。无论是ZPedia还是光子星球的评测,Qwen 3.8在收到一个复杂任务时,第一反应不是直接开始写代码,而是先把需求拆解成清晰的步骤,规划好模块边界,然后再逐步实现。

这种"先想清楚再动手"的习惯,在之前的开源模型中其实很少见。大多数模型拿到需求就开写,写到一半发现结构有问题再回头改。Qwen 3.8的这种表现,更像是一个有经验的高级工程师的工作方式。

首轮完整度极高

在过去,用大模型生成代码往往需要多轮对话来回修补——第一轮生成框架,第二轮补全逻辑,第三轮修bug。但Qwen 3.8在很多测试场景中做到了首轮就给出接近可用的完整输出。光子星球的测试中,一个全栈Todo应用甚至一次生成就通过了全部测试用例。

这背后可能有两个原因:一是模型本身的能力提升,二是双推理机制中思考模式的加入让模型在输出前有更充分的"内省"过程。

中文能力:不用多说了

在第三方综合评测中,Qwen 3.8的中文理解能力被标注为"最强"。光子星球的测试更是给出了一个令人意外的结论——在中文写作方面,它的表现甚至优于GPT-5.6。作为一个中国团队开发的模型,中文能力本就是基本功,但在当前这个各家都在卷中文的市场里,能做到"明显领先"仍然值得肯定。

Agent能力:终于不是玩具了

Agent是大模型应用中最热门也最让人头疼的方向。模型能不能自主分析代码仓库、定位问题、给出修复方案?从测试结果来看,Qwen 3.8在Agent场景下成功完成了"分析仓库+找到bug+修复"的完整流程。虽然单次测试不能说明一切,但至少说明这个方向已经从"演示级"走向了"可用级"。

三、实测表现:用数据说话

由于阿里至今没有发布任何官方Benchmark,我们只能依赖第三方评测数据。这本身就是一个值得讨论的话题——一个2.4万亿参数的模型,在发布时不给任何官方评测数据,这在行业里确实少见。

好在第三方评测数据已经足够有参考价值:

LMSYS综合排行榜上,Qwen 3.8的评分比上一代Qwen 3.7高出约15%,排名跻身全球第8至第9位。考虑到这还只是一个预览版,正式版的排名大概率会进一步上升。

开发者论坛的"七项全能"测试中,Qwen 3.8获得了总分第2名的成绩,仅次于Fable 5。这个测试覆盖了编程、推理、写作等多个维度,能较好地反映模型的综合能力。

编程能力方面,Qwen 3.8排名第4,尤其是在前端开发、Three.js、SVG和游戏开发等细分领域拿到了满分。这个成绩说明它在视觉相关和交互相关的编程任务上有着特殊的优势。

不过,更值得关注的是实际场景的深度测试结果:

ZPedia的评测让Qwen 3.8和Kimi K3做了同题对比,五道题中Qwen 3.8成功完成了四道,唯一失败的是3D魔方任务。光子星球的测试则覆盖了更广的范围——LRU Cache算法题全过,全栈Todo应用一次生成,Agent任务成功完成完整流程,中文写作表现亮眼,但3D浮岛任务同样是最弱的环节。

四、竞品对比:和谁打?

当前的大模型竞争格局中,Qwen 3.8最直接的对手是Fable 5。从综合排名来看,Fable 5仍然是"七项全能"的榜首,纯编程能力和长任务稳定性也略胜一筹。

但Qwen 3.8并非没有优势。在协同办公中文理解前端开发这三个维度上,它已经可以和Fable 5正面掰手腕。尤其是前端开发拿到满分这个成绩,对于实际需要做Web项目的开发者来说,是非常有吸引力的。

另一个需要考虑的因素是性价比。Qwen 3.8目前处于预览期,使用成本近乎免费。即使正式版开始收费,基于阿里云的定价策略,大概率也会保持相对亲民的价格区间。对于中小团队和个人开发者来说,这往往比"绝对能力最强"更重要。

五、不足之处:客观看待

没有模型是完美的,Qwen 3.8也不例外。根据目前的评测反馈,以下几个问题比较突出:

无官方Benchmark——这是目前最大的争议点。作为一个头部厂商发布的重要模型,不提供官方评测数据,很难不让外界产生各种猜测。是后训练还没完成?还是成绩不够理想?无论原因是什么,这都影响了开发者的信任度和采用决策。

3D和创意编码能力偏弱——两轮独立测试都显示,Qwen 3.8在3D相关任务(魔方、浮岛)上表现不佳。这说明模型在空间推理和创意性编码方面仍有明显的提升空间。

长任务稳定性存疑——在需要长时间、多步骤推进的复杂任务中,模型的表现还不够稳定。虽然单次Agent任务成功完成了,但这距离"生产级可靠"还有距离。

视觉精修不足——在需要精细视觉输出的场景中,模型的细节处理能力还有提升空间。这可能和多模态后训练尚未完全收敛有关。

边界收尾粗糙——部分测试中,模型在任务的最后阶段(收尾、边界情况处理)表现不够精细,给人一种"前面做得很好但最后草草了事"的感觉。

这些不足在很大程度上可以归结为一个原因:后训练尚未完成。作为一个预览版,Qwen 3.8展示的是模型的"骨架"和"潜力",而精细的打磨还需要时间。

六、使用体验:值得关注的一点

对于想要尝鲜的开发者,Qwen 3.8目前可以通过阿里云的API接口进行调用。预览期的定价策略非常友好,基本上可以零成本进行大量测试。

在实际使用中,建议针对不同类型的任务选择不同的推理模式:复杂推理、代码生成、长文档分析等场景优先使用思考模式;简单问答、翻译、格式转换等场景使用快速模式即可。双模式切换的设计在体验上的区分度还是比较明显的。

另外,128K的上下文窗口在绝大多数场景下已经足够。如果你有超长文档处理的需求,可以尝试申请1M token的扩展权限,但要注意这可能会带来更高的延迟和成本。

七、总结:一个潜力巨大的"半成品"

如果用一句话概括Qwen 3.8,那就是:骨架已经长成,但肌肉还没练完。

2.4万亿参数的MoE架构、原生多模态、双推理机制——这些底层设计都说明阿里在这代模型上下了很大的赌注。而从第三方的实测表现来看,这个"半成品"已经具备了相当强的竞争力,在多个维度上逼近甚至追平了当前最强的竞品。

但同时也要清醒地认识到,缺少官方Benchmark、3D能力薄弱、长任务稳定性不足等问题,都说明这还不是一个可以直接扔到生产环境里用的模型。

对于开发者来说,我的建议是:

  • 如果你做前端开发、中文内容创作、或者需要Agent能力,Qwen 3.8值得现在就开始关注和试用

  • 如果你需要3D开发、创意编码、或者对长任务稳定性要求极高,建议继续观望正式版

  • 无论如何,Qwen 3.8展示了国产大模型在工程化能力上的又一次跃升,这个方向本身就值得关注
  • 最后,阿里承诺Qwen 3.8会开源权重。如果这个承诺兑现,再加上2.4万亿参数的规模,它很可能会成为开源大模型领域新的标杆。但在权重正式发布之前,一切都还是未知数。

    我们拭目以待。

    💬 评论区 (0)

    暂无评论,快来抢沙发吧!