效率提升显著但智力未涨。适合大规模部署的成本敏感型场景,不适合需要顶级推理能力的任务。
2026年7月21日,谷歌DeepMind一口气发布三款新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber。没有发布会,没有倒计时,直接在播客里宣布,然后API上线。
这个发布节奏本身就说明了一个问题:谷歌不认为这三款模型是"颠覆性"的,它们是"补刀性"的。目标不是震惊业界,而是填补Anthropic和OpenAI之间的价格空白带。
一句话评价:智力没涨但便宜了17%、快了一倍。如果你用Gemini 3.5 Flash觉得"够用但太贵",3.6 Flash就是为你准备的。如果你期望谷歌终于追上Claude Sonnet 5或GPT-5.6——这次没有。
这次发布不是"一个模型三个版本",而是三个完全不同定位的产品:
| 模型 | 定位 | 输入价/1M | 输出价/1M | 速度 | 适用场景 |
|---|---|---|---|---|---|
| Gemini 3.6 Flash | 通用效率型 | $1.50 | $7.50 | 中等 | 编程、知识工作、多步任务 |
| Gemini 3.5 Flash-Lite | 极速轻量型 | $0.30 | $2.50 | 350 tok/s | 文档处理、搜索、高频调用 |
| Gemini 3.5 Flash Cyber | 安全专用型 | 未公开 | 未公开 | - | 漏洞挖掘(仅政府/合作方) |
核心变化就两个词:更省、更快。Artificial Analysis的发布前测试显示,Intelligence Index 50分,与3.5 Flash完全持平。但完成同样的多步骤任务,3.6 Flash少用了17%的输出Token,推理步骤也更少。
翻译成人话就是:同样的活儿,新版干得更利索、花的钱更少,但活儿的质量没变。
每秒350个输出Token、输入价$0.30/1M——这个定价直接对标DeepSeek V3的$0.26/1M。谷歌显然在用Flash-Lite抢夺那些"不需要顶级智力但需要海量调用"的场景:搜索摘要、文档分类、客服机器人。
在V8引擎(Chrome和Node.js的JS引擎)实测中发现了55个安全问题,其中10个是前所未见的新型漏洞。这个成绩比Anthropic和OpenAI的安全模型都强。但谷歌只给政府和"可信合作伙伴"用——技术最亮眼的模型反而是大多数人用不到的。
| 基准测试 | Gemini 3.5 Flash | Gemini 3.6 Flash | 变化 |
|---|---|---|---|
| Intelligence Index | 50 | 50 | 持平 |
| DeepSWE(编程) | 37% | 49% | +12pp |
| OSWorld(计算机操作) | 78.4% | 83% | +4.6pp |
| MLE Bench | 49% | 未公布 | - |
| Token消耗 | 基准 | -17% | 节省 |
仔细看这张表,你会发现谷歌的叙事很聪明。他们重点宣传的是DeepSWE从37%到49%的大幅提升,但对Intelligence Index持平这件事轻描淡写带过。
真相是:3.6 Flash在"执行效率"上有进步,但在"推理能力"上完全没有突破。
DeepSWE和OSWorld的提升说明什么?说明3.6 Flash更擅长"按步骤执行任务"——写代码、操作电脑、调用工具。这些恰恰是AI Agent场景的核心能力。所以3.6 Flash的真正定位不是"更聪明的模型",而是"更好的Agent执行引擎"。
谷歌不跟OpenAI和Anthropic卷"谁的模型更聪明",而是卷"谁的模型执行任务更高效更便宜"。这是一条差异化竞争路线。
| 模型 | 智力指数 | 输入价/1M | 输出价/1M | 上下文 | 核心优势 |
|---|---|---|---|---|---|
| Gemini 3.6 Flash | 50 | $1.50 | $7.50 | 1M | 效率最高、成本适中 |
| Gemini 3.5 Flash-Lite | ~40 | $0.30 | $2.50 | 1M | 极致便宜、速度最快 |
| DeepSeek V3 | ~48 | $0.26 | $0.38 | 128K | 开源、价格最低 |
| Claude Sonnet 5 | ~65 | $3.00 | $15.00 | 1M | 编程最强、推理强 |
| GPT-5.6 Terra | ~60 | $2.50 | $15.00 | 1.1M | 综合能力强 |
| Kimi K3 | ~52 | 免费 | 免费 | 1M | 开源2.8万亿参数 |
同样处理100万输入+20万输出的任务(典型Agent工作流):
结果很清楚:DeepSeek V3仍然是最便宜的,Flash-Lite第二,3.6 Flash排第三。但如果你需要1M上下文窗口+多模态能力+Agent工具调用,3.6 Flash的综合体验确实是目前最均衡的选择。
问题在于:有多少用户真的需要1M上下文?大多数Agent任务的上下文在32K-128K之间。在这个范围内,DeepSeek V3和Kimi K3的性价比碾压Gemini 3.6 Flash。
这次发布会最大的负面信号不是3.6 Flash智力没涨,而是旗舰模型Gemini 3.5 Pro再次跳票。
原定6月发布的3.5 Pro已经延期了两个月,谷歌只说"正在与合作伙伴测试",没有给出新时间表。路透社此前报道称,3.5 Pro延期是因为在内部测试中表现不及预期——谷歌在旗舰模型上遇到了瓶颈。
对比一下竞品的节奏:
谷歌在AI竞赛中的位置正在变得尴尬:Flash系列在"效率"赛道有竞争力,但在"智力"赛道已经落后OpenAI和Anthropic整整一代。Kimi K3的评测也显示,开源模型正在快速追赶闭源。
Gemini 3.6 Flash是一台"更好的发动机"——更省油、跑得更快,但马力和上一代一样。谷歌押注的是"效率"而非"智力",这个策略在Agent时代可能是对的——毕竟Agent需要调用模型几百上千次,17%的Token节省意味着17%的成本下降。
但问题是:当DeepSeek V3的价格只有你的1/9、Kimi K3直接免费、Claude Sonnet 5的编程能力碾压你时,"效率提升17%"这个卖点够不够撑住市场份额?
谷歌真正的希望在于Gemini 3.5 Pro。但那款模型什么时候能发布、发布后能不能追上GPT-5.6和Claude Fable 5——目前都是未知数。3.6 Flash只是止血,不是治愈。