Gemini 3.6 Flash 发布,但用户不买账:更便宜的 Token,更笨的 AI?
如果你从去年开始关注 Gemini,你可能听过这个笑话:就像看着自己的兄弟慢慢患上阿尔茨海默症。通常,新模型的发布是终结这类笑话的绝佳机会。但在谷歌推出三款新模型——3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber——之后,笑声反而更大了。就好像公司在说:“我们知道你不相信我们,但我们还是会让你失望。”
首先来看旗舰产品:Gemini 3.6 Flash。这是对 5 月 I/O 大会上推出的 3.5 Flash 的轻微升级,定位为工作主力模型。最大的卖点?Token 节省。根据 Artificial Analysis Index,3.6 Flash 的输出 Token 比前代减少 17%,在复杂编码场景中最多减少 65%。价格也下降了:每百万输入 Token 1.5 美元,每百万输出 Token 7.5 美元,而之前是 9 美元。更快更便宜——听起来不错,对吧?

在基准测试中,代码能力有所提升:DeepSWE 从 37% 上升到 49%,模型现在减少了不必要的代码更改。机器学习研究的 MLE Bench 从 49.7% 跃升至 63.9%。计算机操作(OSWorld-Verified)从 78.4% 提高到 83%,并且现在成为 Gemini API 的内置工具。一个微小但受欢迎的更新:知识截止日期终于从 2025 年 1 月更新到 2026 年 3 月。在安全方面,谷歌表示 3.6 Flash 升级了 Frontier Safety 保护,针对化学、生物、放射、核和网络威胁,并具有更好的越狱抵抗能力。

接下来是 3.5 Flash-Lite,专注于速度和性价比。它是 3.5 系列中最快的,每秒生成 350 个 Token。价格极低:每百万输入 Token 0.3 美元,每百万输出 Token 2.5 美元。质量明显优于 3 月份的 3.1 Flash-Lite。它支持可调节的推理级别,因此简单任务运行快速,复杂任务可以更深入思考。计算机操作也是内置的。
基准测试改进显著:Terminal-Bench2.1 从 31% 跃升至 54%,长上下文 GDM-MRCR v2 从 60.1% 提高到 72.2%,实际任务执行 GDPval-AA v2 从 642 提高到 1140。有趣的是,这个较低级别的模型在许多代理和代码任务中实际上超越了其更高级别的兄弟 3Flash——例如 SWE-Bench Pro(54.2% 对比 49.6%)和 OSWorld-Verified(74.0% 对比 65.1%)。因此,以前由 3Flash 处理的任务现在有了更快、更强的替代方案。
然后是 3.5 Flash Cyber,这是一个专门用于发现和修复安全漏洞的模型。谷歌的逻辑是:AI 发现漏洞的速度比人类修复的速度快,那么为什么不使用 AI 来修补它们呢?它基于 3.5 Flash 微调,并与 CodeMender 配对,多个代理协同工作并总结成报告。在 CyberGym 基准测试中,它达到了顶级水平,同时使用了更少的 Token。但它不公开可用——谷歌效仿 Anthropic 的做法,将其锁定,仅向受信任的合作伙伴提供有限访问权限进行内部测试。目标是让防御者在攻击者利用之前有时间修补。
那么真正的旗舰产品 3.5 Pro 在哪里?据谷歌称,它仍在与合作伙伴进行测试。但幕后情况并不顺利。彭博社报道称,3.5 Pro 的代码生成从未达到内部预期。谷歌在 6 月底更新了训练数据以修复代码缺陷,但结果并未改善。甚至有传言称,最初的训练计划被废弃并重新开始。与此同时,谷歌 AI 发言人 Logan Kilpatrick 在公开声明中公然跳过 3.5 Pro,将焦点转向 Gemini 4,声称其预训练是“最大、最雄心勃勃的”,并且进展令人兴奋。鉴于旗舰产品的延迟,这感觉像是在转移注意力。
仅看 Flash 模型,网友们并不买账。第三方评估机构 Artificial Analysis 表示,新模型将任务时间减半,并提高了 Token 效率,Flash-Lite 的智能指数提高了 11 点。但 3.6 Flash 的智能水平与 3.5 Flash 基本保持不变。降价不足以忽视能力差距,能力提升也不足以证明成本合理。在 X 上,用户批评 3.6 Flash 在 Artificial Analysis 上的得分与 3.5 Flash 完全相同,并且低于 Meta Spark1.1、GLM-5.2、5.6Luna、Sonnet5、Grok4.5 和 5.6Terra 等竞争对手。一位用户称其“简直糟糕透顶”。
用户 Angel 指出,3.6 Flash 的使用成本高于 GPT-5.6Sol medium,但智能水平更低——对于一个以性价比为基础的系列来说,这是一个尴尬的组合。与此同时,OpenAI 的 Tibo 宣布,由于每周活跃用户达到 1000 万,Codex 和 ChatGPT Work 的付费用户获得了新的配额重置。对比鲜明。
实际测试者火上浇油。用户 Balder 批评这三款模型比之前的 3.5 Flash 更差,问题包括基本解码错误、奇怪的中文用词、图像和视频质量差、与指令不匹配、严重限制、频繁记忆混乱以及错误的工具调用。他甚至开玩笑说,谷歌可能正在释放计算能力卖给 Anthropic——讽刺地称之为“Pichai 想要的——Cloud First”。X 用户 Conor Dart 测试了使用谷歌自己的 Antigravity 生成的 AI 游戏,结果木材纹理更差,大理石看起来几乎相似但仍然无法使用。他称其为又一次失败,表示宁愿等待 Gemini 3.5 或 3.6 Pro。
一方面,官方账号强调效率、更低的价格和更少的 Token。另一方面,大多数网友给出负面反馈,同时伴随着旗舰产品延迟、顶尖人才流失和市值缩水等坏消息。很难不怀疑谷歌是否搞错了技术路线,过于关注成本节省而忘记了提升智能,依赖少数 Flash 模型来稳定局面。无论如何,Gemini 4 的预训练已经开始。如果这次尝试也失败,阿尔茨海默症的笑话可能会成为预言。
要点
- Gemini 3.6 Flash 提供 17% 更少的 Token 和更低的价格,但智能得分持平。
- 3.5 Flash-Lite 在许多任务中超越其更高级别的兄弟,基准测试提升显著。
- 3.5 Flash Cyber 是专门的安全模型,但访问受限。
- 旗舰产品 3.5 Pro 被推迟,原因是代码生成问题;谷歌将焦点转向 Gemini 4。
- 用户反馈普遍负面,指出质量和价值相比竞争对手有所倒退。