Kimi K3 评测:前端代码全球第一,但这只是开始
7月16日,月之暗面(Moonshot AI)正式发布了 Kimi K3,一个拥有 2.8 万亿参数的混合专家架构(MoE)模型。这可能是今年国产 AI 模型中争议最大的一次发布——因为月之暗面自己在公告第一句就承认:K3 的整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol。
但紧接着,它在前端代码竞技场上拿下了全球第一。
核心参数
基准测试表现
在第三方评测机构 Artificial Analysis 的测试中,K3 在 14 项测试中击败 GPT-5.6 Sol 11 项,全面击败 Claude Opus 4.8。在 Frontend Code Arena 前端代码竞技场中,K3 以 1679 分登顶全球第一,超越了 Claude Fable 5(1631 分)和 GPT-5.6 Sol(1618 分)。
综合智能指数方面,K3 得分 57,Fable 5 为 60,GPT-5.6 Sol 为 59,Opus 4.8 为 56。K3 位居第三,但与最顶尖的闭源模型差距已经非常小。
优势亮点
前端开发:这是 K3 最强的领域。7 个前端细分领域,K3 拿了 6 个第一。如果你是前端开发者,K3 目前是你能用到的最好模型。
3D 和视觉生成:K3 在 3D 交互生成、SVG 视觉生成方面表现突出。有开发者用 K3 生成了可玩的 3D 射击游戏、CS:GO 克隆版,甚至用 Three.js 构建了可探索的微型城市。在视觉审美上,K3 生成的画面比 GPT-5.6 Sol 更有设计感。
长上下文:100 万 token 的上下文窗口意味着你可以一次性扔进去整本书、整份代码库,不用切分、不用分段,对处理大量文档的场景是质变。
Agent 能力:K3 在 Agent 任务上表现出色,在 BrowseComp(91.2)、Automation Bench(30.8)和 SpreadsheetBench 2(34.8)上领先。
不足之处
速度是最大短板:同一场景的生成时间约为 GPT-5.6 Sol 的两到三倍。默认开启 max 档位深度思考,生成一个瀑布场景近半小时,视频剪辑近两小时。官方后续会增加 low 和 high 档位来改善。
综合能力仍有差距:虽然在前端和视觉生成上领先,但在通用推理、知识问答等场景下,K3 与 Fable 5 和 GPT-5.6 Sol 仍存在可感知的差距。
API 涨价:K3 的 API 输入价格 20 元/百万 token,输出 100 元/百万 token,比上一代 K2.6 涨了约 3.5 倍。虽然相比 Fable 5(输入 10 美元/输出 50 美元)仍便宜三分之一,但涨幅激进。
权重暂未开放:2.8 万亿参数的 MoE 模型,即使每次只激活部分专家,本地部署仍需要极高算力。普通用户想跑起来,门槛不低。
谁适合用 K3?
结语
K3 不是全能冠军,它是前端开发的单项冠军。月之暗面自己坦诚承认与顶级模型有差距,但在特定场景做到了全球第一,价格只有竞品的三分之一,还要开源。这种务实的产品策略,或许比"全面超越"的宣传更值得信赖。
7 月 27 日权重开放后,如果开源社区能快速跟进,K3 的生态优势可能会真正爆发。
💬 评论区 (0)
暂无评论,快来抢沙发吧!