2026年8月的"双雄同日"发布
2026年8月13日,AI模型赛道出现了罕见的"同日双发":Google推出Gemini 3.7 Flash,OpenAI上线GPT-5.6 Sol的Ultrafast模式。两款模型不约而同地将焦点对准了同一个关键词——效率。这不是巧合,而是行业进入"推理成本军备竞赛"后的必然产物:当模型智商差距缩小,速度和成本就成了决胜变量。
Gemini 3.7 Flash:Google的"最智能劳模"
Google将Gemini 3.7 Flash定位为"最智能的劳模型(workhorse model)",专为编码和Agent场景打造。它距上一代3.6 Flash仅三周,迭代速度本身就是一个信号。
基准测试跃升
| 基准测试 | Gemini 3.6 Flash | Gemini 3.7 Flash | 提升 |
| --- | --- | --- | --- |
| FrontierCode 1.1 | 34.4% | 43.6% | +9.2pp |
| DeepSWE v1.1 | 49.0% | 65.3% | +16.3pp |
| GDP.pdf 文档推理 | 22.0% | 34.0% | +12.0pp |
| AutomationBench | 17.0% | 30.4% | +13.4pp |
编码能力的大幅提升是3.7 Flash的核心卖点。FrontierCode 1.1从34.4%跃升至43.6%,DeepSWE(软件工程代理基准)从49.0%飙升至65.3%——这意味着它在"端到端完成一个软件工程任务"的能力上有了质的飞跃。
定价策略
Gemini 3.7 Flash定价为每百万输入token 0.75美元,恰好是3.6 Flash价格的一半。这个"半价升级"的策略非常精准:在能力大幅提升的同时降低门槛,既抢夺开发者心智,又挤压竞争对手的定价空间。Google还同步将Gemini Spark升级为使用3.7 Flash,让消费级产品也享受到最新能力。
GPT-5.6 Sol Ultrafast:750 tokens/秒的极速推理
OpenAI为GPT-5.6 Sol推出的Ultrafast模式,由Cerebras提供算力支撑,最高可达每秒750个输出token,比标准处理快14倍。这个速度意味着什么?一篇500字的文章,大约0.7秒就能生成完毕——人类的阅读速度都跟不上它的输出速度。
目标场景
Ultrafast模式明确面向时间敏感型业务工作流:
首批客户包括Jane Street(量化交易)、Podium、Basis和Rogo,都是对延迟极其敏感的场景。OpenAI强调,Ultrafast是"在不牺牲前沿智能的前提下追求速度",针对的是较小的模型,而非简单降配换速度。
Codex的百万token上下文
与Ultrafast同步,OpenAI Codex开放了基于GPT-5.6 Sol的100万token上下文窗口(文档上限为105万token)。开发者通过编辑配置文件即可启用:
# ~/.codex/config.toml
model = "gpt-5.sol"
model_context_window = 1000000
model_auto_compact_token_limit = 900000 # 预留10%压缩余量设置时将model_auto_compact_token_limit留出约10万token的余量(设为90万),可以在触发自动压缩前充分保留上下文。更大的上下文让Codex能记住更多代码、工具输出和对话历史,但OpenAI也提醒:默认值是经过性能与成本仔细调优的,盲目拉满上下文未必划算。
横向对比:该选谁?
| 维度 | Gemini 3.7 Flash | GPT-5.6 Sol Ultrafast |
| --- | --- | --- |
| 核心定位 | 智能劳模,编码+Agent | 极速推理,低延迟 |
| 最大优势 | 推理深、编码强 | 750 tokens/秒,14倍速 |
| 最适场景 | 复杂多步工程、软件代理 | 实时对话、即时分析 |
| 输入token定价 | $0.75/百万 | 未公开(按速计费) |
| 上下文窗口 | 长上下文 | 100万token(Codex) |
| 算力合作方 | Google自研TPU | Cerebras |
选型建议
选Gemini 3.7 Flash的场景: 需要复杂的多步推理和软件工程代理能力,任务对"想得对"的要求高于"想得快"。比如自动代码审查、架构设计、端到端Bug修复——这类任务单次调用耗时本就较长,速度提升的边际收益不如推理质量。
选GPT-5.6 Sol Ultrafast的场景: 延迟是硬约束的实时场景,比如客服机器人、实时翻译、金融行情解读。这类场景中,0.5秒和5秒的用户体验差距是决定性的。
两者结合的混合策略: 这也正是OpenRouter这类路由平台的价值所在——用一个轻量分类器判断任务复杂度,简单任务走Ultrafast追求速度,复杂任务走3.7 Flash追求深度。NVIDIA的NeMo Switchyard框架在145个多轮Agent任务测试中,通过动态路由将成本降低了74%而质量不变,验证了混合路由的可行性。
效率新纪元的三个底层逻辑
逻辑一:算力架构创新成为速度突破口
GPT-5.6 Sol Ultrafast的14倍加速并非来自模型本身的变大或变小,而是来自Cerebras的晶圆级算力架构。这预示着一个趋势:模型推理速度的下一个突破点,很可能不在算法层,而在芯片架构层。当传统GPU的内存带宽成为瓶颈,Cerebras这类"整片晶圆做一个芯片"的方案提供了新路径。
逻辑二:定价从"按量"走向"按场景"
Gemini 3.7 Flash的半价策略和Ultrafast的分级计费,都指向同一个方向:定价正在从单纯的"按token计费"走向"按场景价值计费"。开发者需要开始关注:同样的任务在不同模型上的实际成本,往往相差数倍。
逻辑三:效率红利正在向中小企业扩散
当每百万token的输入成本降到0.75美元、当百万token上下文成为标配,先进AI能力的门槛正在快速降低。中小企业过去用不起的"长文档分析""全代码库理解"等能力,正在变成基础设施级的标准配置。
一个实用的成本估算框架
对于需要评估模型成本的开发者,可以参考以下估算思路:
def estimate_monthly_cost(
daily_requests, # 日均请求数
avg_input_tokens, # 平均输入token
avg_output_tokens, # 平均输出token
input_price_per_million, # 输入价格($/百万)
output_price_per_million # 输出价格($/百万)
):
monthly_input = daily_requests * avg_input_tokens * 30
monthly_output = daily_requests * avg_output_tokens * 30
cost = (monthly_input / 1_000_000) * input_price_per_million \
+ (monthly_output / 1_000_000) * output_price_per_million
return round(cost, 2)
# 示例:每天1000次请求,平均输入2000、输出500 token
# 使用 Gemini 3.7 Flash(输入$0.75/M,假设输出$3/M)
print(estimate_monthly_cost(1000, 2000, 500, 0.75, 3.0))
# 输出约 126.0 美元/月在做技术选型时,建议把"月度成本估算""最坏情况下的成本上限""降级方案"三件事一起规划,避免账单 surprises。
结语
Gemini 3.7 Flash和GPT-5.6 Sol Ultrafast的同日发布,不是两个产品的偶然撞期,而是整个行业从"卷智能"转向"卷效率"的缩影。对开发者而言,好消息是能力更强了、成本更低了、速度更快了;挑战在于选择更多了、组合更复杂了。理解每个模型的"甜区"(sweet spot),比追逐单项最高分更重要。
💬 评论区 (0)
暂无评论,快来抢沙发吧!