Gemini 3.6 Flash评测:速度翻倍但智力原地踏步,谷歌在赌什么?

AI Tools Hub · 2026年7月23日 · 深度评测

7.2 / 10

综合评分:7.2 / 10

效率提升显著但智力未涨。适合大规模部署的成本敏感型场景,不适合需要顶级推理能力的任务。

评测结论先行

2026年7月21日,谷歌DeepMind一口气发布三款新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber。没有发布会,没有倒计时,直接在播客里宣布,然后API上线。

这个发布节奏本身就说明了一个问题:谷歌不认为这三款模型是"颠覆性"的,它们是"补刀性"的。目标不是震惊业界,而是填补Anthropic和OpenAI之间的价格空白带。

一句话评价:智力没涨但便宜了17%、快了一倍。如果你用Gemini 3.5 Flash觉得"够用但太贵",3.6 Flash就是为你准备的。如果你期望谷歌终于追上Claude Sonnet 5或GPT-5.6——这次没有。

✅ 优点

  • Token消耗降低17%,成本显著下降
  • 推理速度翻倍,响应体验提升
  • DeepSWE编程评分从37%→49%
  • OSWorld计算机操作83%(接近顶尖)
  • 1M上下文窗口保持不变

❌ 缺点

  • Intelligence Index 50分,与3.5 Flash持平
  • 没有旗舰Pro版本同步发布
  • Gemini 3.5 Pro再次跳票(已延期2个月)
  • 编程能力虽有提升但远落后Claude/GPT
  • Cyber版本不向普通开发者开放

一、三款模型到底有什么区别?

这次发布不是"一个模型三个版本",而是三个完全不同定位的产品:

模型定位输入价/1M输出价/1M速度适用场景
Gemini 3.6 Flash通用效率型$1.50$7.50中等编程、知识工作、多步任务
Gemini 3.5 Flash-Lite极速轻量型$0.30$2.50350 tok/s文档处理、搜索、高频调用
Gemini 3.5 Flash Cyber安全专用型未公开未公开-漏洞挖掘(仅政府/合作方)

3.6 Flash:主力军的"效率升级"

核心变化就两个词:更省、更快。Artificial Analysis的发布前测试显示,Intelligence Index 50分,与3.5 Flash完全持平。但完成同样的多步骤任务,3.6 Flash少用了17%的输出Token,推理步骤也更少。

翻译成人话就是:同样的活儿,新版干得更利索、花的钱更少,但活儿的质量没变。

3.5 Flash-Lite:谷歌版"DeepSeek V3"

每秒350个输出Token、输入价$0.30/1M——这个定价直接对标DeepSeek V3的$0.26/1M。谷歌显然在用Flash-Lite抢夺那些"不需要顶级智力但需要海量调用"的场景:搜索摘要、文档分类、客服机器人。

3.5 Flash Cyber:最有趣的一个

在V8引擎(Chrome和Node.js的JS引擎)实测中发现了55个安全问题,其中10个是前所未见的新型漏洞。这个成绩比Anthropic和OpenAI的安全模型都强。但谷歌只给政府和"可信合作伙伴"用——技术最亮眼的模型反而是大多数人用不到的

二、跑分深度解读:谷歌藏了什么?

基准测试Gemini 3.5 FlashGemini 3.6 Flash变化
Intelligence Index5050持平
DeepSWE(编程)37%49%+12pp
OSWorld(计算机操作)78.4%83%+4.6pp
MLE Bench49%未公布-
Token消耗基准-17%节省

仔细看这张表,你会发现谷歌的叙事很聪明。他们重点宣传的是DeepSWE从37%到49%的大幅提升,但对Intelligence Index持平这件事轻描淡写带过。

真相是:3.6 Flash在"执行效率"上有进步,但在"推理能力"上完全没有突破。

DeepSWE和OSWorld的提升说明什么?说明3.6 Flash更擅长"按步骤执行任务"——写代码、操作电脑、调用工具。这些恰恰是AI Agent场景的核心能力。所以3.6 Flash的真正定位不是"更聪明的模型",而是"更好的Agent执行引擎"。

谷歌不跟OpenAI和Anthropic卷"谁的模型更聪明",而是卷"谁的模型执行任务更高效更便宜"。这是一条差异化竞争路线。

三、与竞品横评:性价比 vs 绝对实力

模型智力指数输入价/1M输出价/1M上下文核心优势
Gemini 3.6 Flash50$1.50$7.501M效率最高、成本适中
Gemini 3.5 Flash-Lite~40$0.30$2.501M极致便宜、速度最快
DeepSeek V3~48$0.26$0.38128K开源、价格最低
Claude Sonnet 5~65$3.00$15.001M编程最强、推理强
GPT-5.6 Terra~60$2.50$15.001.1M综合能力强
Kimi K3~52免费免费1M开源2.8万亿参数

性价比分析

同样处理100万输入+20万输出的任务(典型Agent工作流):

结果很清楚:DeepSeek V3仍然是最便宜的,Flash-Lite第二,3.6 Flash排第三。但如果你需要1M上下文窗口+多模态能力+Agent工具调用,3.6 Flash的综合体验确实是目前最均衡的选择。

问题在于:有多少用户真的需要1M上下文?大多数Agent任务的上下文在32K-128K之间。在这个范围内,DeepSeek V3和Kimi K3的性价比碾压Gemini 3.6 Flash。

四、Gemini 3.5 Pro跳票:真正的隐忧

这次发布会最大的负面信号不是3.6 Flash智力没涨,而是旗舰模型Gemini 3.5 Pro再次跳票

原定6月发布的3.5 Pro已经延期了两个月,谷歌只说"正在与合作伙伴测试",没有给出新时间表。路透社此前报道称,3.5 Pro延期是因为在内部测试中表现不及预期——谷歌在旗舰模型上遇到了瓶颈

对比一下竞品的节奏:

谷歌在AI竞赛中的位置正在变得尴尬:Flash系列在"效率"赛道有竞争力,但在"智力"赛道已经落后OpenAI和Anthropic整整一代。Kimi K3的评测也显示,开源模型正在快速追赶闭源。

五、谁该用Gemini 3.6 Flash?

✅ 推荐使用的场景

❌ 不推荐使用的场景

最终评价

Gemini 3.6 Flash是一台"更好的发动机"——更省油、跑得更快,但马力和上一代一样。谷歌押注的是"效率"而非"智力",这个策略在Agent时代可能是对的——毕竟Agent需要调用模型几百上千次,17%的Token节省意味着17%的成本下降。

但问题是:当DeepSeek V3的价格只有你的1/9、Kimi K3直接免费、Claude Sonnet 5的编程能力碾压你时,"效率提升17%"这个卖点够不够撑住市场份额?

谷歌真正的希望在于Gemini 3.5 Pro。但那款模型什么时候能发布、发布后能不能追上GPT-5.6和Claude Fable 5——目前都是未知数。3.6 Flash只是止血,不是治愈。

相关阅读

`n `n