Gemini 3.6 Flash 发布:Google的"美国豆包"又进化了,效率暴涨17%
2026年7月21日,Google DeepMind低调发布了Gemini 3.6 Flash——以及伴随它的3.5 Flash-Lite和3.5 Flash Cyber三款新模型。没有I/O式的盛大发布会,但这次更新可能是Google在2026年下半年最重要的一步棋。
如果你把Gemini比作Google的"豆包"(中国用户对AI助手的昵称),那3.6 Flash就是这个豆包的又一次"发酵"——更大、更快、更省。

一、三款新模型一览
| 模型 | 定位 | 输入价格 | 输出价格 | 核心优势 |
|------|------|---------|---------|---------|
| Gemini 3.6 Flash | 编码+知识工作主力 | $1.50/百万token | $7.50/百万token | token效率提升17%,编码能力大幅跃升 |
| Gemini 3.5 Flash-Lite | 高吞吐低成本 | $0.30/百万token | $2.50/百万token | 3.5系列中最快最便宜,部分指标超越3 Flash |
| Gemini 3.5 Flash Cyber | 安全漏洞检测 | 限制访问 | 限制访问 | 专攻代码安全,仅面向政府和可信合作伙伴 |
二、3.6 Flash:效率才是真正的杀手锏
比起跑分,3.6 Flash最让人兴奋的是token效率。在Artificial Analysis Index上,3.6 Flash比上一代3.5 Flash少用了17%的输出token,完成同样的多步骤任务所需的推理步数和工具调用次数也更少。
这意味着什么?同样一块钱的API预算,3.6 Flash能干更多的活。
性能对比(vs 3.5 Flash)
| 基准测试 | Gemini 3.6 Flash | Gemini 3.5 Flash | 提升幅度 |
|---------|------------------|------------------|---------|
| DeepSWE v1.1(长周期软件工程) | 49% | 37% | +32% |
| MLE-Bench(机器学习工程) | 63.9% | 49.7% | +29% |
| OSWorld-Verified(计算机操作) | 83.0% | 78.4% | +6% |
| GDPval-AA v2(知识工作) | 1421 | 1349 | +5% |
| Terminal-Bench 2.1(终端编码) | 78.0% | 76.2% | +2% |
DeepSWE提升了32%是最大的亮点——这个基准测试衡量的是"长周期软件工程"能力,也就是模型能不能在跨多个文件、多个步骤的复杂编码任务中保持一致性。3.6 Flash在这个维度上的跃升,说明它已经从"能写代码"进化到了"能做项目"。
三、与GPT-5.6、Grok 4.5、Claude Sonnet 5的横向对比
Google在官方页面直接放出了与竞品的对比,这在AI大厂中相当罕见。我整理了关键数据:
| 基准测试 | Gemini 3.6 Flash | GPT-5.6 Luna | Grok 4.5 | Claude Sonnet 5 |
|---------|------------------|-------------|----------|-----------------|
| 输入价格 | $1.50 | $1.00 | $2.00 | $3.00 |
| 输出价格 | $7.50 | $6.00 | $6.00 | $15.00 |
| SWE-Bench Pro | 58.7% | 62.7% | 64.7% | 63.2% |
| DeepSWE v1.1 | 49% | 67% | 54% | 54% |
| Terminal-Bench 2.1 | 78.0% | 84.7% | 83.3% | 80.4% |
| MLE-Bench | 63.9% | 47.6% | 43.2% | 66.9% |
| OSWorld-Verified | 83.0% | 72.6% | — | 81.2% |
| GDPval-AA v2 | 1421 | 1584 | 1535 | 1607 |
| 长上下文128k | 91.8% | 74.8% | 81.4% | 71.6% |
| 长上下文1M | 54.0% | — | — | — |
关键发现
3.6 Flash不是全能冠军,但它的"性价比+长上下文"组合无敌。
一句话总结:3.6 Flash是"最聪明的Flash",不是"最聪明的模型"——但它的价格让你用得起。
四、Computer Use:内置到API中
3.6 Flash发布的同时,Google把"计算机操作"(Computer Use)作为内置工具集成到了Gemini API和Gemini Enterprise中。
这意味着什么?以前开发者要实现"AI操控电脑"需要自己写一堆适配代码,现在直接调用API就行。3.6 Flash在OSWorld-Verified上83%的得分说明,它已经能可靠地:
这对Agent开发者来说是重大利好——"AI操作电脑"从Demo阶段正式进入了生产级可用阶段。
五、Flash Cyber:Google的安全王牌
3.5 Flash Cyber可能是这次发布中最"低调但最狠"的产品。它是一个专门为安全漏洞检测微调的模型,目前仅在CodeMender代理中通过受限访问试点提供。
实测成绩
Google DeepMind的Big Sleep团队在Chrome和Safari等复杂代码库上测试了Flash Cyber:
| 模型 | V8引擎中发现的确认可利用漏洞数 |
|------|--------------------------|
| Flash Cyber | 55 |
| Gemini 3.5 Flash | 47 |
| Gemini 3.6 Flash | 36 |
| Claude Opus 4.6 | 36 |
Flash Cyber发现了55个漏洞,其中10个是其他所有模型都没发现的。更让人印象深刻的是,Google云漏洞研究团队用它在两小时内发现了一个公开API中的远程代码执行漏洞和一个生产服务中的内存损坏bug,还生成了能绕过标准内存保护的利用代码。
为什么限制访问?
Google明确表示,由于漏洞研究的"双用途"性质(既能用于防御也能用于攻击),Flash Cyber只提供给政府和可信合作伙伴。这是负责任的做法——一个能自动找漏洞的AI模型如果落入黑产手中,后果不堪设想。
六、CodeMender:从发现到修复的自动化闭环
伴随三款新模型发布的还有CodeMender——一个代码安全代理,今天进入预览阶段。
CodeMender的工作流程三步走:
支持C/C++、Go、Java、Python、Ruby、Rust和TypeScript七种语言。开发者审批后才会提交补丁,也可以接入CI/CD流水线实现自动化运行。
早期企业测试用户包括Salesforce、Robinhood和Palo Alto Networks。Robinhood安全运营负责人Scott Ponte说:"CodeMender持续发现了我们的其他AI安全工具完全遗漏的关键漏洞。"
七、定价策略分析
Google这次的价格策略非常明确——用Flash系列打价格战,抢占开发者市场。
| 模型 | 输入$/百万token | 输出$/百万token | 每百万token总成本 |
|------|----------------|----------------|-------------------|
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | $2.80 |
| GPT-4o mini | ~$0.15 | ~$0.60 | ~$0.75 |
| Gemini 3.6 Flash | $1.50 | $7.50 | $9.00 |
| GPT-5.6 Luna | $1.00 | $6.00 | $7.00 |
| Gemini 3.1 Pro | $2.00 | $12.00 | $14.00 |
| Grok 4.5 | $2.00 | $6.00 | $8.00 |
| Claude Sonnet 5 | $3.00 | $15.00 | $18.00 |
3.5 Flash-Lite的价格已经低到接近"白菜价"——$0.30/百万输入token,这个价格让大规模部署AI Agent在经济上变得可行。3.6 Flash的价格虽然不是最低,但考虑到它的性能(特别是OSWorld和长上下文),性价比非常突出。
八、对行业的影响
1. Agent时代的基础设施
3.6 Flash把Computer Use内置到API中,加上token效率的提升和Flash-Lite的超低价,Google实际上是在铺设"Agent基础设施"——让开发者能以极低成本构建和运行AI Agent。
2. 安全AI的军备竞赛
Flash Cyber + CodeMender的组合标志着AI安全领域进入新阶段。Google选择了"受限开放"的策略——能力很强,但只给可信方使用。这可能会引发其他厂商的跟进。
3. Gemini 4在路上
Google在发布说明中提到,Gemini 3.5 Pro正在与合作伙伴测试,而"迄今最雄心勃勃的预训练运行"正在为Gemini 4进行中。3.6 Flash可能是Gemini 4发布前的最后一次"中场调整"。
九、开发者该如何选择?
根据你的使用场景,我的建议是:
API快速上手
from google import genai
client = genai.Client(api_key="YOUR_API_KEY")
response = client.models.generate_content(
model="gemini-3.6-flash",
contents="帮我分析这段代码的性能瓶颈,并给出优化建议"
)
print(response.text)3.6 Flash和3.5 Flash-Lite现在就可以通过Google AI Studio和Android Studio使用,3.6 Flash同时也在Google的Antigravity编码工具和Gemini Enterprise应用中可用。
十、总结
Gemini 3.6 Flash不是一次革命性的发布,但它是Google在AI基础设施竞赛中非常务实的一步。
17%的token效率提升看似不大,但在百万级API调用场景下,这意味着真金白银的成本节约。83%的OSWorld得分说明"AI操作电脑"已经从实验阶段走向生产可用。Flash Cyber的55个漏洞发现展示了AI在安全领域的巨大潜力。
Google的"美国豆包"正在悄悄变得更强、更便宜、更安全。而在Gemini 4到来之前,3.6 Flash + Flash-Lite + Flash Cyber的组合,已经足够让竞争对手喝一壶了。
💬 评论区 (0)
暂无评论,快来抢沙发吧!