谷歌的主力模型,在 3.7 更新中规模更大
Gemini 3.7 Flash 价格减半,随后给出理由
谷歌 Gemini 3.7 Flash 以 3.6 Flash 首发价的一半推出,同时宣称在编程、Web 开发和知识工作基准测试上取得进步。该模型在上一代 Flash 发布三周后上市,并为智能体构建者带来了新的性价比论据。

谷歌于 2026 年 8 月 13 日发布 Gemini 3.7 Flash,而此次更新的首要亮点是 Flash 系列鲜少以降价作为主打。该模型每百万输入令牌收费 0.75 美元,每百万输出令牌收费 3.75 美元,首发价格持续至年底,仅为三周前发布的 Gemini 3.6 Flash 原价的一半。谷歌将 3.7 Flash 定位为面向编码与智能体应用的主力模型。
这一时机是经过深思熟虑的。谷歌今年一直保持 Gemini 产品线的快速迭代节奏,3.6 Flash 一代于 7 月问世,同时推出的还有更轻量、更快的 Flash-Lite。3.7 的快速更迭看起来更像是一种惯例,而非一项新发现。谷歌将这一速度归因于开发者反馈以及其称将延续到未来模型中的算法改进。这一节奏此前已引发关注:据此前的泄露报道,有泄露信息显示谷歌正在测试 3.6 Flash 版本,而备受期待的 Pro 模型依然缺席。
基准测试,以及 50% 的降价
更引人注目的故事在于谷歌公布的与上一代 Flash 对比的数据。该公司报告 FrontierCode 1.1 Main 得分从 34.4% 升至 43.6%,DeepSWE v1.1 从 49.0% 升至 65.3%,谷歌称这一差距意味着更好的首次代码准确率和更接近生产就绪的输出。这一趋势不止于编码领域:GPA.pdf 在文档密集型知识工作方面从 22.0% 升至 34.0%,AutomationBench 在真实世界业务流程方面从 17.0% 升至 30.4%,WebDev Arena 的 Elo 评分从 1538 升至 1588。
| 基准测试 | 3.7 Flash | 3.6 Flash |
|---|---|---|
| FrontierCode 1.1 Main | 43.6% | 34.4% |
| DeepSWE v1.1 | 65.3% | 49.0% |
| GDP.pdf | 34.0% | 22.0% |
| AutomationBench | 30.4% | 17.0% |
| WebDev Arena (Elo) | 1588 | 1538 |
这些是谷歌自己公布的数字,关于第一方基准测试的常见保留意见依然适用。不过,将它们作为一个整体来看,这些数据讲述了一个特定的故事:该公司声称在编码、网页开发和文档处理方面持续取得智能体性能提升,然后对每令牌收取更低的价格。某个基准测试略有提升,另一个大约翻倍,价格却减半。这种组合在通常便宜意味着慢、轻或不准确的市场中并不多见。这也是一个竞争对手基准测试声明快速变化的市场:xAI 的 Grok 4.6 在综合指数上与 GPT-5.6 Sol 并列 61 分,随后其分项得分出现分化,详见分数明细。
价格对智能体经济的信号意义
谷歌对 3.7 Flash 的用词是经过斟酌的。“主力”一词意在争取高吞吐量的智能体工作负载,在这种场景下,每百万令牌的成本会在反复运行的循环中不断累积。该公司强化了这一框架:该模型专为多步骤规划和工具调用而构建,谷歌表示它能够更忠实地遵循指令,并将其转化为更少的重试次数和工程工作流中更少的人工监督。这一卖点并非谷歌独有。Meta 将其 30B Muse Glimmer 直接瞄准智能体工作负载,并使其在 20GB 以下即可运行,详见Muse Glimmer 的报道。
首发定价的设定才是让这次发布显得颇具战略意味的地方。永久降价会被解读为成本故事;限时降价则是立下标杆。谷歌在说的是,这就是赢得开发者转向其智能体技术栈所需付出的代价,而基准测试页面正是这一宣传的一部分。即使在令牌定价激进的今年,五折也是一种激进的举措:智谱的 GLM-5.2 以每百万令牌 0.07 美元的价格走红,降幅达 95%,被网友称为“几乎免费”,还有一条回复称价格已经上涨了 10 倍,详见GLM-5.2 定价风波。在这一点上,分数的重要性不及价格和发布节奏。如果这成为常态,那么 Gemini 3.7 Flash 与其说是一个产品发布,不如说是在表明其后续替代产品将以怎样惯常的速度到来。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。