Gemini 3.6 Flash发布:Google的"美国豆包"又进化了,效率暴涨17%

Gemini 3.6 Flash 发布:Google的"美国豆包"又进化了,效率暴涨17%

2026年7月21日,Google DeepMind低调发布了Gemini 3.6 Flash——以及伴随它的3.5 Flash-Lite和3.5 Flash Cyber三款新模型。没有I/O式的盛大发布会,但这次更新可能是Google在2026年下半年最重要的一步棋。

如果你把Gemini比作Google的"豆包"(中国用户对AI助手的昵称),那3.6 Flash就是这个豆包的又一次"发酵"——更大、更快、更省。

Gemini 3.6 Flash

一、三款新模型一览

| 模型 | 定位 | 输入价格 | 输出价格 | 核心优势 |
|------|------|---------|---------|---------|
| Gemini 3.6 Flash | 编码+知识工作主力 | $1.50/百万token | $7.50/百万token | token效率提升17%,编码能力大幅跃升 |
| Gemini 3.5 Flash-Lite | 高吞吐低成本 | $0.30/百万token | $2.50/百万token | 3.5系列中最快最便宜,部分指标超越3 Flash |
| Gemini 3.5 Flash Cyber | 安全漏洞检测 | 限制访问 | 限制访问 | 专攻代码安全,仅面向政府和可信合作伙伴 |

二、3.6 Flash:效率才是真正的杀手锏

比起跑分,3.6 Flash最让人兴奋的是token效率。在Artificial Analysis Index上,3.6 Flash比上一代3.5 Flash少用了17%的输出token,完成同样的多步骤任务所需的推理步数和工具调用次数也更少。

这意味着什么?同样一块钱的API预算,3.6 Flash能干更多的活。

性能对比(vs 3.5 Flash)

| 基准测试 | Gemini 3.6 Flash | Gemini 3.5 Flash | 提升幅度 |
|---------|------------------|------------------|---------|
| DeepSWE v1.1(长周期软件工程) | 49% | 37% | +32% |
| MLE-Bench(机器学习工程) | 63.9% | 49.7% | +29% |
| OSWorld-Verified(计算机操作) | 83.0% | 78.4% | +6% |
| GDPval-AA v2(知识工作) | 1421 | 1349 | +5% |
| Terminal-Bench 2.1(终端编码) | 78.0% | 76.2% | +2% |

DeepSWE提升了32%是最大的亮点——这个基准测试衡量的是"长周期软件工程"能力,也就是模型能不能在跨多个文件、多个步骤的复杂编码任务中保持一致性。3.6 Flash在这个维度上的跃升,说明它已经从"能写代码"进化到了"能做项目"。

三、与GPT-5.6、Grok 4.5、Claude Sonnet 5的横向对比

Google在官方页面直接放出了与竞品的对比,这在AI大厂中相当罕见。我整理了关键数据:

| 基准测试 | Gemini 3.6 Flash | GPT-5.6 Luna | Grok 4.5 | Claude Sonnet 5 |
|---------|------------------|-------------|----------|-----------------|
| 输入价格 | $1.50 | $1.00 | $2.00 | $3.00 |
| 输出价格 | $7.50 | $6.00 | $6.00 | $15.00 |
| SWE-Bench Pro | 58.7% | 62.7% | 64.7% | 63.2% |
| DeepSWE v1.1 | 49% | 67% | 54% | 54% |
| Terminal-Bench 2.1 | 78.0% | 84.7% | 83.3% | 80.4% |
| MLE-Bench | 63.9% | 47.6% | 43.2% | 66.9% |
| OSWorld-Verified | 83.0% | 72.6% | — | 81.2% |
| GDPval-AA v2 | 1421 | 1584 | 1535 | 1607 |
| 长上下文128k | 91.8% | 74.8% | 81.4% | 71.6% |
| 长上下文1M | 54.0% | — | — | — |

关键发现

3.6 Flash不是全能冠军,但它的"性价比+长上下文"组合无敌。

  • 编码能力:GPT-5.6 Luna和Grok 4.5在SWE-Bench Pro和DeepSWE上领先,但价格更低或持平

  • 计算机操作:3.6 Flash以83%的OSWorld-Verified得分全场第一,这是Agent时代最关键的指标

  • 长上下文:128k上下文91.8%、1M上下文54%,远超所有竞品——Google的长上下文优势依然稳固

  • 知识工作:GDPval-AA v2上Claude Sonnet 5和GPT-5.6更强,但3.6 Flash的价格只有它们的1/2到1/3

  • 机器学习工程:MLE-Bench上3.6 Flash以63.9%排名第二,仅次于Claude Sonnet 5的66.9%
  • 一句话总结:3.6 Flash是"最聪明的Flash",不是"最聪明的模型"——但它的价格让你用得起。

    四、Computer Use:内置到API中

    3.6 Flash发布的同时,Google把"计算机操作"(Computer Use)作为内置工具集成到了Gemini API和Gemini Enterprise中。

    这意味着什么?以前开发者要实现"AI操控电脑"需要自己写一堆适配代码,现在直接调用API就行。3.6 Flash在OSWorld-Verified上83%的得分说明,它已经能可靠地:

  • 理解屏幕截图中的UI元素

  • 规划点击、输入、滚动等操作序列

  • 在多步骤任务中保持目标一致性
  • 这对Agent开发者来说是重大利好——"AI操作电脑"从Demo阶段正式进入了生产级可用阶段。

    五、Flash Cyber:Google的安全王牌

    3.5 Flash Cyber可能是这次发布中最"低调但最狠"的产品。它是一个专门为安全漏洞检测微调的模型,目前仅在CodeMender代理中通过受限访问试点提供。

    实测成绩

    Google DeepMind的Big Sleep团队在Chrome和Safari等复杂代码库上测试了Flash Cyber:

    | 模型 | V8引擎中发现的确认可利用漏洞数 |
    |------|--------------------------|
    | Flash Cyber | 55 |
    | Gemini 3.5 Flash | 47 |
    | Gemini 3.6 Flash | 36 |
    | Claude Opus 4.6 | 36 |

    Flash Cyber发现了55个漏洞,其中10个是其他所有模型都没发现的。更让人印象深刻的是,Google云漏洞研究团队用它在两小时内发现了一个公开API中的远程代码执行漏洞和一个生产服务中的内存损坏bug,还生成了能绕过标准内存保护的利用代码。

    为什么限制访问?

    Google明确表示,由于漏洞研究的"双用途"性质(既能用于防御也能用于攻击),Flash Cyber只提供给政府和可信合作伙伴。这是负责任的做法——一个能自动找漏洞的AI模型如果落入黑产手中,后果不堪设想。

    六、CodeMender:从发现到修复的自动化闭环

    伴随三款新模型发布的还有CodeMender——一个代码安全代理,今天进入预览阶段。

    CodeMender的工作流程三步走:

  • 扫描(Scan):扫描代码仓库,查找内存损坏、注入、加密弱点等漏洞

  • 验证(Verify):尝试构建exploit并在客户控制的沙箱中运行,验证漏洞是否真实存在

  • 修复(Remediate):如果exploit成功,自动生成补丁,以代码diff形式返回给开发者审批
  • 支持C/C++、Go、Java、Python、Ruby、Rust和TypeScript七种语言。开发者审批后才会提交补丁,也可以接入CI/CD流水线实现自动化运行。

    早期企业测试用户包括Salesforce、Robinhood和Palo Alto Networks。Robinhood安全运营负责人Scott Ponte说:"CodeMender持续发现了我们的其他AI安全工具完全遗漏的关键漏洞。"

    七、定价策略分析

    Google这次的价格策略非常明确——用Flash系列打价格战,抢占开发者市场

    | 模型 | 输入$/百万token | 输出$/百万token | 每百万token总成本 |
    |------|----------------|----------------|-------------------|
    | Gemini 3.5 Flash-Lite | $0.30 | $2.50 | $2.80 |
    | GPT-4o mini | ~$0.15 | ~$0.60 | ~$0.75 |
    | Gemini 3.6 Flash | $1.50 | $7.50 | $9.00 |
    | GPT-5.6 Luna | $1.00 | $6.00 | $7.00 |
    | Gemini 3.1 Pro | $2.00 | $12.00 | $14.00 |
    | Grok 4.5 | $2.00 | $6.00 | $8.00 |
    | Claude Sonnet 5 | $3.00 | $15.00 | $18.00 |

    3.5 Flash-Lite的价格已经低到接近"白菜价"——$0.30/百万输入token,这个价格让大规模部署AI Agent在经济上变得可行。3.6 Flash的价格虽然不是最低,但考虑到它的性能(特别是OSWorld和长上下文),性价比非常突出。

    八、对行业的影响

    1. Agent时代的基础设施

    3.6 Flash把Computer Use内置到API中,加上token效率的提升和Flash-Lite的超低价,Google实际上是在铺设"Agent基础设施"——让开发者能以极低成本构建和运行AI Agent。

    2. 安全AI的军备竞赛

    Flash Cyber + CodeMender的组合标志着AI安全领域进入新阶段。Google选择了"受限开放"的策略——能力很强,但只给可信方使用。这可能会引发其他厂商的跟进。

    3. Gemini 4在路上

    Google在发布说明中提到,Gemini 3.5 Pro正在与合作伙伴测试,而"迄今最雄心勃勃的预训练运行"正在为Gemini 4进行中。3.6 Flash可能是Gemini 4发布前的最后一次"中场调整"。

    九、开发者该如何选择?

    根据你的使用场景,我的建议是:

  • 大量低复杂度任务(如内容分类、简单问答、数据提取)→ 3.5 Flash-Lite,$0.30的输入价格几乎没有竞争对手

  • 编码和知识工作(如代码生成、文档分析、Agent开发)→ 3.6 Flash,token效率最高,OSWorld第一

  • 复杂推理和创意任务Gemini 3.1 Pro或等待3.5 Pro

  • 代码安全审计 → 申请CodeMender + Flash Cyber的受限访问
  • API快速上手

    python
    from google import genai
    
    client = genai.Client(api_key="YOUR_API_KEY")
    
    response = client.models.generate_content(
        model="gemini-3.6-flash",
        contents="帮我分析这段代码的性能瓶颈,并给出优化建议"
    )
    
    print(response.text)

    3.6 Flash和3.5 Flash-Lite现在就可以通过Google AI Studio和Android Studio使用,3.6 Flash同时也在Google的Antigravity编码工具和Gemini Enterprise应用中可用。

    十、总结

    Gemini 3.6 Flash不是一次革命性的发布,但它是Google在AI基础设施竞赛中非常务实的一步。

    17%的token效率提升看似不大,但在百万级API调用场景下,这意味着真金白银的成本节约。83%的OSWorld得分说明"AI操作电脑"已经从实验阶段走向生产可用。Flash Cyber的55个漏洞发现展示了AI在安全领域的巨大潜力。

    Google的"美国豆包"正在悄悄变得更强、更便宜、更安全。而在Gemini 4到来之前,3.6 Flash + Flash-Lite + Flash Cyber的组合,已经足够让竞争对手喝一壶了。

    💬 评论区 (0)

    暂无评论,快来抢沙发吧!