谷歌于 9 月 2 日开始提供 AI 模型「Gemini 3.8 Flash」。它紧随三周前发布的 3.7 Flash,是六周内的第三款 Flash 系列模型。新模型在软件开发、智能体任务以及专业领域的多步推理方面有所提升,同时维持了与 3.7 Flash 相同的推广价。谷歌这次强调的特点是一种设计取向:任务越难,模型执行的推理步骤越多,调用工具也越频繁,用谷歌自己的话说,就是 3.8 Flash"更肯干"。

每三周迭代一代的 Flash

Flash 系列是 Gemini 家族中侧重速度和单价、面向实际生产用途的产品线。今年夏天它的更新节奏格外密集:3.6 Flash、3.7 Flash,再到此次的 3.8 Flash,几乎每隔三周就有新版本号。独立评测机构 Artificial Analysis 将其算作不到四个月内的第四款 Flash 模型。

谷歌将 3.8 Flash 定位为"最聪明的主力模型",并表示它与同日发布的网络安全专用版本「Gemini 3.8 Flash Cyber」共享同一套基础智能。据谷歌介绍,在要求极高的网络安全领域进行的严格训练,带动了这一共享核心在编程和推理能力上的整体提升,也就是说面向安全的研发成果反哺了通用模型。Cyber 版本以及向可信防御方提供该模型的「Fairwind Program」已另有文章介绍,本文只聚焦面向一般用户的 3.8 Flash。

基准测试中哪些方面有提升

从谷歌公布的结果看,进步最明显的是需要长时间自主运行的任务。

在衡量长周期软件工程能力的「DeepSWE v1.1」上,谷歌称 3.8 Flash 在端到端自主解决复杂工程问题方面超过了大多数规模更大的前沿模型,而且成本只是它们的一小部分。

在专业领域,它在金融分析智能体基准「Vals Finance Agent V2」和法律智能体基准「Harvey's Legal Agent Benchmark」上超越了 3.7 Flash 及其他前沿模型。在跨学科难题集「HLE-Verified」上取得 54.9% 的成绩,谷歌以此说明模型能够胜任涵盖理工、人文和专业职业领域的多步推理。

以上数字均为谷歌自行公布。独立机构 Artificial Analysis 同日发布的测评显示,在"高"推理强度下,该模型在综合指标 Intelligence Index 上得到 59 分,比 3.7 Flash 的 56 分高出 3 分。该机构认为,提升主要来自智能体类评测,其中以银行业务为题材的工具调用评测「τ³-Banking」涨幅最大,比 3.7 Flash 高 12 分,达到 45%。"中"强度下得 57 分,"低"强度下得 52 分;"低"档的成绩与 3.6 Flash 的"高"档相同,但每任务成本低 30%,耗时约为三分之一。

"更肯干"意味着消耗更多 token

谷歌这次正面解释了性能提升的来源。面对复杂任务,3.8 Flash 被设计成表现出更多"勤勉":执行额外的推理步骤,并反复调用工具。谷歌明确写道,因此模型有时会使用更多 token 来最大化性能,在较高强度下尤其如此。

这一点在独立测评中也有体现。据 Artificial Analysis 的数据,尽管每 token 单价与 3.7 Flash 相同,每任务成本却从 0.40 美元(约 64 日元)上升到 0.58 美元(约 92 日元),涨幅约四成。原因是每任务的平均输出 token 增加三成,达到 4.8 万个,同时智能体类评测中的交互轮次也有所增加。"高"强度下的每任务耗时也从 2.2 分钟延长到 2.5 分钟,不过输出速度本身仍保持在每秒约 300 个 token 的水平。

尽管如此,该机构仍把 3.8 Flash 放在智能与成本的帕累托前沿上,称其是"同等智能水平中最便宜的模型"。把推理强度调到"中",每任务成本降至 0.41 美元(约 65 日元),调到"低"则为 0.24 美元(约 38 日元),用户可以根据用途降低强度档位。谷歌也建议,在计算效率是首要约束的场景下,可以使用较低的强度档位,或继续使用仍受完整支持的 3.7 Flash。

价格年内不变,2027 年起翻倍

价格与 3.7 Flash 的推广价相同:每百万输入 token 0.75 美元(约 120 日元),每百万输出 token 3.75 美元(约 600 日元)。不过这一单价仅限于 2026 年 12 月 31 日之前,从 2027 年 1 月 1 日起,输入将调整为 1.50 美元(约 240 日元),输出为 7.50 美元(约 1,200 日元)。缓存输入 token 九折优惠继续适用。

※1 美元 = 159 日元(按 2026 年 9 月 2 日收盘价折算)

如前所述,同样的任务下 3.8 Flash 倾向于比 3.7 Flash 消耗更多 token。即使单价相同,长时间运行智能体的场景,实际账单也可能高于 3.7 Flash,而到明年年初单价本身还会翻倍。在按推广价估算并确定方案之前,最好把 2027 年以后的单价和 token 消耗的增加一并考虑进去。

上下文长度为 100 万 token,与 3.7 Flash 相同。输入支持文本、图像、视频和音频,输出为文本。知识截止日期因领域而异,部分为 2026 年 3 月,部分领域可能仅到 2025 年 1 月。

可用渠道

3.8 Flash 自发布起即可通过各渠道使用。开发者可以通过 Google AI Studio 和 Android Studio 的 Gemini API、智能体开发环境「Google Antigravity」以及界面生成工具「Stitch」使用。企业用户可通过 Gemini Enterprise 获取。个人用户方面,Google AI Pro 和 Ultra 订阅者可以在 Gemini 应用、谷歌搜索的 AI 模式以及 Google 表格内的 Gemini 中使用 3.8 Flash。

谷歌同时公开了多个演示,例如在 Antigravity 中用简单提示词搭建出带解谜元素的 3D 游戏、以 DOS 风格重现地图服务,以及利用美国地质调查局的真实数据生成地形图可视化。这些展示明显针对的是一条指令就能让模型长时间持续工作的智能体用途。

安全方面,模型出厂即带有针对化学、生物、放射性和核(CBRN)以及网络攻击滥用的防护措施。据 Gray Swan 的评测,Gemini 3.8 一代在抵御提示词注入方面也有大幅改善。

总结

Gemini 3.8 Flash 在 3.7 Flash 发布仅三周后再进一代,是面向实际生产的主力模型,在长周期软件开发任务、智能体处理以及金融、法律等专业领域均有提升。独立测评的 Intelligence Index 上升 3 分至 59。输入 0.75 美元、输出 3.75 美元的推广价年内维持不变,但"更肯干"的设计带来了更高的 token 消耗,每任务成本上涨约四成。2027 年起单价还将翻倍,引入时应把这两点一并纳入考量。