Google 於 9 月 2 日開始提供 AI 模型「Gemini 3.8 Flash」。它接在三週前推出的 3.7 Flash 之後,是六週內的第三款 Flash 系列模型。新模型在軟體開發、代理任務以及專業領域的多步驟推理上有所提升,同時維持與 3.7 Flash 相同的推廣價。Google 這次強調的特點是一種設計取向:任務越困難,模型執行的推理步驟越多,呼叫工具也越頻繁,用 Google 自己的說法,就是 3.8 Flash「更賣力」。
每三週就換一代的 Flash
Flash 系列是 Gemini 家族中重視速度與單價、面向實際生產用途的產品線。今年夏天它的更新節奏格外密集:3.6 Flash、3.7 Flash,再到這次的 3.8 Flash,幾乎每隔三週就有新的版本號。獨立評測機構 Artificial Analysis 將它算作不到四個月內的第四款 Flash 模型。
Google 將 3.8 Flash 定位為「最聰明的主力模型」,並表示它與同日發表的資安專用版本「Gemini 3.8 Flash Cyber」共用同一套基礎智慧。根據 Google 的說明,在要求嚴苛的資安領域進行的嚴格訓練,帶動了這個共用核心在程式撰寫與推理能力上的整體提升,也就是說面向資安的研發成果回饋到了通用模型。Cyber 版本以及向可信任防禦方提供該模型的「Fairwind Program」已另有文章介紹,本文只聚焦一般使用者可用的 3.8 Flash。
基準測試中哪些方面有進步
從 Google 公布的結果來看,進步最明顯的是需要長時間自主運作的任務。
在衡量長週期軟體工程能力的「DeepSWE v1.1」上,Google 表示 3.8 Flash 在端到端自主解決複雜工程問題方面超越了大多數規模更大的前沿模型,而且成本只有它們的一小部分。
在專業領域,它在金融分析代理基準「Vals Finance Agent V2」與法律代理基準「Harvey's Legal Agent Benchmark」上超越了 3.7 Flash 及其他前沿模型。在跨領域難題集「HLE-Verified」上取得 54.9% 的成績,Google 以此說明模型能夠勝任涵蓋理工、人文與專業職業領域的多步驟推理。
以上數字都是 Google 自行公布的。獨立機構 Artificial Analysis 同日發布的評測顯示,在「高」推理強度下,該模型在綜合指標 Intelligence Index 上拿到 59 分,比 3.7 Flash 的 56 分高出 3 分。該機構認為,進步主要來自代理類評測,其中以銀行業務為題材的工具使用評測「τ³-Banking」漲幅最大,比 3.7 Flash 高 12 分,達到 45%。「中」強度下為 57 分,「低」強度下為 52 分;「低」檔的成績與 3.6 Flash 的「高」檔相同,但每項任務的成本低 30%,耗時約為三分之一。
「更賣力」代表消耗更多 token
Google 這次正面說明了效能提升的來源。面對複雜任務,3.8 Flash 被設計成展現更多「勤奮」:執行額外的推理步驟,並反覆呼叫工具。Google 明確寫道,因此模型有時會使用更多 token 來讓效能最大化,在較高強度下尤其如此。
這一點在獨立評測中也看得到。根據 Artificial Analysis 的資料,儘管每 token 單價與 3.7 Flash 相同,每項任務的成本卻從 0.40 美元(約 64 日圓)上升到 0.58 美元(約 92 日圓),漲幅約四成。原因是每項任務的平均輸出 token 增加三成,達到 4.8 萬個,同時代理類評測中的往返次數也增加了。「高」強度下的每項任務耗時也從 2.2 分鐘拉長到 2.5 分鐘,不過輸出速度本身仍維持在每秒約 300 個 token。
即便如此,該機構仍將 3.8 Flash 放在智慧與成本的柏拉圖前緣上,稱它是「同等智慧水準中最便宜的模型」。把推理強度調到「中」,每項任務成本降到 0.41 美元(約 65 日圓),調到「低」則是 0.24 美元(約 38 日圓),使用者可以依用途調低強度檔位。Google 也建議,在運算效率是首要限制的情境下,可以使用較低的強度檔位,或繼續使用仍受完整支援的 3.7 Flash。
價格年內不變,2027 年起翻倍
價格與 3.7 Flash 的推廣價相同:每百萬輸入 token 0.75 美元(約 120 日圓),每百萬輸出 token 3.75 美元(約 600 日圓)。不過這個單價僅限 2026 年 12 月 31 日之前,從 2027 年 1 月 1 日起,輸入將改為 1.50 美元(約 240 日圓),輸出為 7.50 美元(約 1,200 日圓)。快取輸入 token 的九折優惠繼續適用。
※1 美元 = 159 日圓(依 2026 年 9 月 2 日收盤價換算)
如前所述,同樣的任務下 3.8 Flash 傾向比 3.7 Flash 消耗更多 token。即使單價相同,長時間運行代理的情境,實際帳單也可能高於 3.7 Flash,而到了明年年初單價本身還會翻倍。在依推廣價估算並定案之前,最好把 2027 年以後的單價與 token 消耗的增加一併納入考量。
脈絡長度為 100 萬 token,與 3.7 Flash 相同。輸入支援文字、圖片、影片與音訊,輸出為文字。知識截止日期因領域而異,部分為 2026 年 3 月,部分領域可能僅到 2025 年 1 月。
可用管道
3.8 Flash 自發表起即可透過各管道使用。開發者可以透過 Google AI Studio 與 Android Studio 的 Gemini API、代理開發環境「Google Antigravity」以及介面生成工具「Stitch」使用。企業使用者可透過 Gemini Enterprise 取得。個人使用者方面,Google AI Pro 與 Ultra 的訂閱者可以在 Gemini 應用程式、Google 搜尋的 AI 模式以及 Google 試算表內的 Gemini 中使用 3.8 Flash。
Google 同時公開了多個示範,例如在 Antigravity 中以簡單提示詞組出帶有解謎元素的 3D 遊戲、以 DOS 風格重現地圖服務,以及利用美國地質調查局的真實資料生成地形圖視覺化。這些展示明顯瞄準的是一道指令就能讓模型長時間持續工作的代理用途。
安全方面,模型出廠即具備針對化學、生物、放射性與核(CBRN)以及網路攻擊濫用的防護措施。根據 Gray Swan 的評測,Gemini 3.8 世代在抵禦提示詞注入方面也有大幅改善。
總結
Gemini 3.8 Flash 在 3.7 Flash 推出僅三週後再進一代,是面向實際生產的主力模型,在長週期軟體開發任務、代理處理以及金融、法律等專業領域都有提升。獨立評測的 Intelligence Index 上升 3 分至 59。輸入 0.75 美元、輸出 3.75 美元的推廣價年內維持不變,但「更賣力」的設計帶來更高的 token 消耗,每項任務成本上漲約四成。2027 年起單價還會翻倍,導入時應把這兩點一併納入評估。
