混元Hy3 vs DeepSeek V4-Pro vs Qwen 3.7-Max 实测横评:谁才是性价比之王?

混元Hy3 vs DeepSeek V4-Pro vs Qwen 3.7-Max 实测横评:谁才是性价比之王?

最近有读者问:DeepSeek V4 价格要翻倍,还有没有性价比更高、但能力又跟得上的大模型?带着这个问题,我把同一个 Agent 任务分别丢给了腾讯混元 Hy3、DeepSeek V4-Pro 和通义千问 Qwen3.7-Max,结果有点出乎意料。

一、先看价格表:差距比想象的大

在正式开测之前,先把三个模型的 API 价格摆出来,这是大多数开发者最关心的硬指标:

| 模型 | 输入价格(元/百万 token) | 输出价格(元/百万 token) |
|------|--------------------------|--------------------------|
| 混元 Hy3 | 1 | 4 |
| DeepSeek V4-Pro | 3 | 6 |
| Qwen 3.7-Max | 12 | 36 |

如果只看价格,Hy3 最便宜,但便宜到底是不是因为能力不行?光看定价表没有意义,得拉出来跑一跑。

二、模型基本盘

三个模型的体量差距其实很大:

  • 混元 Hy3:295B 参数,腾讯最新推出,重点强化 Agent 和 Coding 能力

  • DeepSeek V4-Pro:1.6T 参数,49B 激活,当前开源模型的标杆

  • Qwen 3.7-Max:参数量超万亿,阿里旗舰级模型
  • 从参数规模看,Hy3 是三者里最小的。但 Agent 能力不是简单比参数,还得看架构设计和后训练质量。

    从官方给出的 Agent 相关 benchmark 来看,Hy3 在 BrowseComp、MCP Atlas、ClawEval 和 SkillsBench 等几个核心指标上表现都不错:

    Hy3 官方 Agent 能力评测

    但光看官方跑分没有意义,关键是在真实任务中表现如何。下面直接进入实测。

    三、测试方法

    这次我选了两个完全不同方向的 Agent 任务:

    任务一:3D 飞行躲避小游戏 —— 测 Coding Agent 能力。让模型用 Three.js 生成一个可直接运行的单文件 3D 小游戏,包含玩家控制、障碍物生成、能量收集、计分系统、碰撞检测和重开功能。这个任务考验模型能不能把一个前端交互需求拆成完整模块,并一次性生成可运行、有状态闭环的代码。

    任务二:Excel 数据分析微信小程序 —— 测 Working Agent 能力,也就是更接近办公生产力的场景。让模型基于 Excel 文件生成一个微信小程序版的数据分析看板,支持上传、字段识别、汇总计算、核心指标卡片、趋势图、分类对比图和数据洞察。

    裁判有两位:

  • 3D 小游戏任务:Gemini 3.1-Pro 打分

  • 小程序任务:Codex 综合评分(因为是完整工程项目,需要全面分析项目完成度)
  • 四、任务一:3D 飞行躲避小游戏

    1)Hy3 的表现

    在 WorkBuddy 中选择 Hy3 模型,输入提示词后,它生成了完整的 Three.js 3D 飞行躲避游戏。

    Hy3 3D游戏结果

    游戏整体效果流畅,飞行器控制、障碍物生成、能量点收集、计分系统和碰撞检测都正常工作。从 GIF 录屏来看,交互反馈及时,视觉效果也不错。

    2)DeepSeek V4-Pro 的表现

    同样的提示词发给 DeepSeek V4-Pro,生成结果如下:

    DeepSeek V4-Pro 3D游戏结果

    V4-Pro 的完成度也很高,游戏逻辑完整,运行流畅。作为当前公认的代码能力最强的开源模型之一,这个表现在意料之中。

    3)Qwen 3.7-Max 的表现

    Qwen 3.7-Max 需要在 WorkBuddy 中配置其他模型接口(填入 API Base 和 API Key),配置好后生成结果:

    Qwen 3.7-Max 3D游戏结果

    Qwen 的表现同样不错,毕竟是万亿参数级别的旗舰模型。游戏功能完整,视觉效果也很好。

    4)Gemini 评分结果

    让 Gemini 3.1-Pro 作为裁判,对三个模型生成的 HTML 文件进行综合评分,结果如下:

    Hy3 以微弱优势获得第一,Qwen 3.7-Max 第二,DeepSeek V4-Pro 第三。

    但三者的得分差距非常小,并且都处于很高的分数区间。这说明在这个级别的任务上,三个模型的完成度都非常不错,差距只在细节处理上。

    五、任务二:Excel 数据分析微信小程序

    这个任务比 3D 小游戏复杂得多,因为它不是生成一个单文件,而是要理解小程序的目录结构,拆分页面、脚本和样式,还要处理 Excel 数据解析和可视化。

    1)Hy3 的表现

    Hy3 生成了完整的微信小程序工程文件结构:

    Hy3 小程序项目结构

    导入到微信开发者工具后,Excel 上传、数据解析、指标卡片和可视化图表都正常工作。数据可视化在手机端预览效果如下:

    Hy3 小程序数据可视化

    整体来看,Hy3 在这个任务中的表现相当稳定,Excel 导入解析正常,数据分析功能完整。

    2)DeepSeek V4-Pro 的表现

    V4-Pro 也生成了完整的项目结构,小程序启动后的首页、导入页面都正常。但在实际导入 Excel 文件时,出现了一个 bug——提示未能从文件中提取到有效数据。这个问题可以继续通过迭代修复,但就首轮表现来说,这是一个明显的扣分点。

    3)Qwen 3.7-Max 的表现

    Qwen 生成的小程序项目结构完整,导入到微信开发者工具后效果如下:

    Qwen 小程序结果

    Qwen 在可视化呈现方面做得最好,图表设计和交互体验都比较精致。毕竟万亿参数的规模摆在那里,在视觉呈现和前端细节上有优势。

    4)Codex 评分结果

    对于完整工程项目,Codex 给出了三项分项得分:

  • Excel 导入与解析稳定性:Hy3 第一

  • 数据分析与洞察完整度:Hy3 第一

  • 可视化与交互呈现:Qwen 3.7-Max 第一
  • 这个评分结果和实际测试中的观感基本吻合。Hy3 在功能完整性和稳定性上占优,Qwen 在视觉呈现上更好,而 V4-Pro 因为 Excel 解析的 bug 拖了后腿。

    六、结论:性价比之王是谁?

    这次测试了两个真实的 Agent 任务,覆盖了 Coding Agent 和 Working Agent 两个典型场景。三个模型的参数规模差异很大(295B vs 1.6T vs 万亿级),但实际表现的差距远没有参数差距那么大。

    最让人意外的是混元 Hy3。 作为三者中参数最小的模型,它在两个 Agent 任务中的表现都能追到甚至超过参数量更大的 DeepSeek V4-Pro 和 Qwen 3.7-Max。尤其是在 Excel 数据分析小程序任务中,Hy3 在导入稳定性和数据分析完整度两项上都拿了第一。

    再回头看价格:

    | 模型 | 输入价格 | 输出价格 | 综合表现 |
    |------|---------|---------|---------|
    | 混元 Hy3 | 1元/百万 token | 4元/百万 token | 优秀 |
    | DeepSeek V4-Pro | 3元/百万 token | 6元/百万 token | 优秀 |
    | Qwen 3.7-Max | 12元/百万 token | 36元/百万 token | 优秀 |

    Hy3 的输入价格是 Qwen 的 1/12,输出价格是 Qwen 的 1/9,但能力差距并不大。对于需要高频调用的生产环境来说,这个价格差带来的成本差异是非常可观的。

    结论很明确:如果你的预算有限但又需要高质量的 Agent 能力,混元 Hy3 是目前性价比最突出的选择。 即使是预算充足的团队,把 Hy3 作为日常主力模型、把 Qwen 留作复杂任务的"杀手锏",可能也是一个非常务实的组合策略。

    感兴趣的话,可以直接在 WorkBuddy 里体验 Hy3,目前还是免费阶段。


    参考来源:郭震(公众号)实测报告

    💬 评论区 (0)

    暂无评论,快来抢沙发吧!