Gemini 3.7 Flash 发布:Google 把高频编程 Agent 推向更低成本

Google 于 2026 年 8 月 13 日发布 Gemini 3.7 Flash,重点强化编程、网页开发和多步骤 Agent 工作流。模型支持最高 100 万 Token 上下文,并以截至年底的推广价格开放给开发者、企业和部分 Gemini 订阅用户。

Gemini 3.7 Flash 光谱核心协调代码、网页、文档与工具节点的科技插画
Gemini 3.7 Flash Google 编程模型 AI Agent Gemini API

Google 在 2026 年 8 月 13 日发布 Gemini 3.7 Flash,距离 Gemini 3.6 Flash 上线约三周。新模型继续承担 Flash 系列的高频主力角色,但升级重点明显向编程和 Agent 倾斜:更高的首次代码准确率、更稳定的多步骤规划,以及在遇到阻碍时调整策略和确认用户意图的能力。

开发者现在可以通过 Google AI Studio、Gemini API、Google Antigravity 和 Android Studio 使用模型;企业入口包括 Gemini Enterprise Agent Platform 与 Gemini Enterprise。Gemini App 中的 Spark 也已面向支持地区的 Google AI Pro、Ultra 订阅用户切换到 Gemini 3.7 Flash。

这次发布还有一项直接影响选型的变化:截至 2026 年 12 月 31 日,Gemini 3.7 Flash 的推广价格为每百万输入 Token 0.75 美元、输出 Token 3.75 美元,只有原 Gemini 3.6 Flash 标准价格的一半。Google 正在用一个更偏工程执行的 Flash 模型,同时压低生产级 Agent 的试用门槛。

Flash 的更新重点从响应速度转向任务完成率

Gemini 3.7 Flash 基于 Gemini 3.6 Flash,Google 称此次进步来自核心推理基础的算法改进和开发者反馈。模型依然强调速度与成本,但官方发布材料反复提到软件工程、知识工作、网页开发和复杂工具调用,说明它的目标已超出简单问答或轻量内容生成。

模型支持文本、图像、音频和视频输入,最高上下文窗口为 100 万 Token,文本输出上限为 64K Token。可定制思考配置让开发者在质量、延迟和成本之间做取舍。对于代码库分析、长文档处理和跨工具工作流,这些规格提供了更大的任务空间;实际调用成本仍会取决于输入长度、思考开销和重试次数。

Google 展示的示例包括生成可玩的 3D 游戏、协调子 Agent 构建交互式网页,以及用三个 Agent 组成的工作流辅助机器人模型训练。这些演示强调的是编排和持续执行,而非单次生成一段代码。

编程、文档与自动化评测均有提升

Google 公布的对比结果显示,Gemini 3.7 Flash 相比 3.6 Flash 在多项目标任务上取得明显进步。

评测

Gemini 3.6 Flash

Gemini 3.7 Flash

测试重点

FrontierCode 1.1 Main

34.4%

43.6%

生产代码质量

DeepSWE v1.1

48.6%

65.3%

长程软件工程

WebDev Arena

1538 Elo

1588 Elo

网页应用生成

AutomationBench

17.0%

30.4%

真实业务自动化

GDP.pdf

22.0%

34.0%

复杂专业 PDF 理解

这组数据说明升级覆盖了代码实现、工具执行和知识密集型文档处理。对小团队更有价值的是,模型如果能减少首次执行错误和循环重试,最终节省的可能不只是一轮 API Token,也包括人工检查和重新下发任务的时间。

厂商评测仍不能直接替代自己的工作负载。Google 模型卡列出的完整对比中,Gemini 3.7 Flash 并未在每个项目领先:它在 DeepSWE v1.1、Agent's Last Exam 和 OSWorld 2.0 等任务上仍有表现更高的对照模型。所谓“最智能的 Flash”是系列内部定位,不应改写成所有场景下的最强模型。

年底前是低价窗口,长期成本需要重新计算

Gemini 3.7 Flash 的推广价格有明确期限,不能当成长期固定价格。

时间

每百万输入 Token

每百万输出 Token

截至 2026 年 12 月 31 日

0.75 美元

3.75 美元

2027 年 1 月 1 日起

1.50 美元

7.50 美元

对准备上线 Agent 的团队,这段低价期适合做规模化验证,但预算模型应同时按恢复后的价格计算。一次真实任务通常包含多轮模型调用、工具执行、上下文回传和错误重试,标价只是总成本的一部分。低价模型若需要频繁人工介入,单任务成本仍可能高于更贵但稳定的方案。

比较模型时可以记录四个指标:任务一次完成率、平均重试次数、完整输入输出 Token、人工接管时间。用同一批真实任务跑完,才能判断 3.7 Flash 的价格优势是否能转化为业务优势。

小团队可以优先测试哪些工作流

Gemini 3.7 Flash 适合先进入候选模型池,而不是直接替换现有生产模型。已有 Google AI Studio 或 Gemini API 工作流的团队,可以从以下场景开始:

  1. 中型代码库修复。 选择有测试套件和验收条件的 Issue,观察模型能否完成定位、修改、测试和回归检查。
  2. 网页原型交付。 使用同一份设计参考和功能清单,对比页面完整度、交互正确性、首次生成可用率及后续修改轮数。
  3. 复杂文档转流程。 输入合同、财务资料或产品规范时先脱敏,再测试信息提取、规则判断与工具调用;高风险结论保留人工复核。
  4. Google Workspace Agent。 对 Spark 或企业工作流,重点验证授权边界、错误恢复和跨应用操作日志,而不是只看最终回答。
Flash 的价值在高频执行。测试重点应放在一周或一个月内能稳定完成多少任务,而不是挑选一次效果最好的演示。

仍需注意知识时效与生产稳定性

Google 模型卡将 Gemini 3.7 Flash 的知识截止时间列为 2026 年 3 月,同时说明部分领域的信息可能仍受 Gemini 3 系列较早知识边界影响。涉及最新政策、价格、产品状态或市场数据的任务,仍需要搜索、企业数据源或其他检索机制补充。

模型也保留基础模型常见的幻觉问题,并可能偶发变慢或超时。Google 为化学、生物、放射性与核风险以及网络攻击滥用更新了防护措施,这类请求的响应边界可能与普通编程任务不同。

Gemini 3.7 Flash 最值得继续观察的,是推广期结束后能否凭较高任务完成率维持合理的单任务成本。对于独立开发者和创业小团队,近期更现实的决定是用可验收的真实任务建立基线,在 2027 年价格恢复前拿到足够数据,再决定是否扩大部署。