谷歌发布了 Gemini 系列的主力模型 3.6 Flash,以及轻量级的 3.5 Flash-Lite。3.6 Flash 的输出 token 消耗比上一代减少 17%,单价也同时下调[1]。此外谷歌还公布了面向安全领域的 3.5 Flash Cyber,并说明了推迟中的 Gemini 3.5 Pro 的进展,以及已经启动的下一代 Gemini 4。

主打效率的 Flash,如今在质量上也不落下风

Flash 系列在 Gemini 家族中的定位,是在效率与质量之间取得平衡。这次的 3.6 Flash 延续了这一路线,同时在性能和单价两方面都超过了上一代的 3.5 Flash。

最直观的数字是 token 效率。根据 Artificial Analysis Index 的测量,3.6 Flash 的输出 token 消耗比 3.5 Flash 少 17%,在 Datacurve 提供的 DeepSWE 等基准中,降幅最高达到 65%[1]。也就是说,完成同样的工作所需的输出更短。

价格方面,输入每 100 万 token 为 1.50 美元(约 240 日元),输出每 100 万 token 为 7.50 美元(约 1,200 日元)[1]。3.5 Flash 的输出单价为每 100 万 token 9 美元,因此单价本身已经下降[2]。消耗的 token 变少,单价也变低,对于需要持续运行智能体的场景,这两项会叠加生效。

从基准测试看 3.6 Flash 的提升

值得注意的是,效率提升并没有以牺牲质量为代价。谷歌给出的对比如下[1]。

DeepSWE 为 49% 对 37%,多余的代码修改和执行循环有所减少。衡量机器学习研究任务的 MLE Bench 为 63.9% 对 49.7%,差距更为明显。涉及电脑操作的 OSWorld-Verified 为 83.0% 对 78.4%,偏向实务评估的 GDPval-AA v2 为 1421 对 1349。

电脑操作能力现已作为客户端内置工具,通过 Gemini API 和 Gemini Enterprise 提供[1]。Hebbia 与 Harvey 等客户表示,该模型在文档解析、图表与数据分析、报告起草等多模态任务上表现出色[1]。

安全方面,谷歌称该模型在化学、生物、放射性与核(CBRN)领域以及网络攻击滥用方面强化了 Frontier Safety 防护,对越狱攻击的抵抗力明显提升。同时,模型也经过训练以减少对正当用途的过度拒绝[1]。

3.5 Flash-Lite 每秒 350 token,负责处理大批量任务

同时发布的 3.5 Flash-Lite 面向低延迟与高吞吐场景,例如智能体检索和大规模文档处理。

根据 Artificial Analysis 的测量,其输出速度为每秒 350 token,是 3.5 系列中最快的[1]。价格为输入每 100 万 token 0.3 美元(约 50 日元),输出每 100 万 token 2.5 美元(约 400 日元)[1]。

与上一代 3.1 Flash-Lite 相比,差距相当明显:Terminal-Bench 2.1 为 54% 对 31%,衡量长上下文的 GDM-MRCR v2 为 72.2% 对 60.1%,GDPval-AA v2 为 1140 对 642[1]。

更有意思的是,在多项智能体与编程评测中,这款轻量模型超过了更高一级的 3 Flash。SWE-Bench Pro 为 54.2% 对 49.6%,OSWorld-Verified 为 74.0% 对 65.1%[1]。新一代的低阶型号反超上一代高阶型号,在这个领域已是常见格局。

思考深度可以分级配置,开发者既能在大批量任务中偏向低延迟、低成本执行,也能在多步骤子智能体工作流中启用更深层的推理[1]。

面向安全的 3.5 Flash Cyber 仅限政府与可信合作伙伴

第三款 3.5 Flash Cyber 基于 3.5 Flash,针对漏洞的发现与修复进行了微调。它在谷歌的代码安全智能体 CodeMender 中以多个实例协同运行,最终汇总为一份报告。谷歌称其在漏洞基准 CyberGym 上达到了前沿水平[1]。

不过这款模型并非人人可用。考虑到该技术攻防两用的性质,它将通过 CodeMender 以限量试点的形式,仅向政府机构与可信合作伙伴提供[1]。其背景是当前发现漏洞的速度已经超过了修复速度,因此收紧发放范围是合理的判断。

3.5 Pro 仍在推迟,视线转向 Gemini 4

本次发布也提到了顶级型号 Gemini 3.5 Pro。目前正与合作伙伴进行测试,将在准备就绪后广泛开放[1],也就是说延期状态仍在持续。

与此同时,谷歌表示已经启动了 Gemini 4 的预训练,并称这是迄今为止最具野心的一次[1]。一边承认顶级型号的延期,一边持续推出主打效率的 Flash 系列,这一组合恰好反映了当前行业的处境。对于已经在生产环境中运行智能体的开发者来说,单个任务的成本比单纯的能力更为迫切。

3.6 Flash 与 3.5 Flash-Lite 自即日起,可通过 Google AI Studio 和 Android Studio 的 Gemini API 使用。3.6 Flash 同时进入 Google Antigravity,企业用户可通过 Gemini Enterprise Agent Platform 使用。普通用户可在 Gemini 应用中使用,3.5 Flash-Lite 也将陆续登陆谷歌搜索[1]。

※1 美元 = 162 日元(以 2026 年 7 月 21 日收盘价计)

总结

谷歌公布的 3.6 Flash 在减少 17% 输出 token 的同时下调了单价,并在 DeepSWE、MLE Bench 等主要评测中超过 3.5 Flash。同期发布的 3.5 Flash-Lite 以每秒 350 token 的速度承担大批量任务,在部分评测中反超了更高一级的 3 Flash。面向安全的 3.5 Flash Cyber 则是仅限政府与可信合作伙伴的限量试点。顶级的 3.5 Pro 仍在测试中,谷歌近期的主战场正从单纯的能力转向单个任务的成本。

来源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/

来源:https://9to5google.com/2026/07/21/gemini-3-6-flash-launch/