Inception 在 9 月 8 日發表了 Mercury 2.5,這是一款以擴散方式取代傳統逐字生成的大型語言模型。生成速度達每秒 1,107 個 token,官方表示智慧水準較 Mercury 2 提升 40%。一直以速度作為賣點的這個系列,如今在品質上也開始與成本最佳化的前沿模型正面比拚。
不是一個個吐字,而是並行落子
多數大型語言模型都是從頭到尾一個 token 接著一個 token 產生文字。Mercury 系列拿掉了這個前提,把影像生成常見的擴散手法帶進語言領域:模型先給出一份粗略草稿,再並行改寫其中的 token,直到結果收斂。由於 token 不必排隊逐一產出,GPU 空轉的時間變少,同樣的硬體也能更快回應。
Inception 表示,Mercury 2.5 是目前市面上能力最強的擴散式大型語言模型,就其所知也是至今訓練規模最大的擴散語言模型。這個速度是在供應廣泛的 NVIDIA GPU 上量測而得,並非仰賴特殊加速器,這一點對實際導入相當重要。
服務條件不變,只把能力往上加
公開的數據說明了它的定位。生成速度為每秒 1,107 個 token,脈絡長度為 260,000 個 token。智慧水準較 Mercury 2 提升 40%,與 GPT-5.6 Luna(Low)、Gemini 3.5 Flash-Lite、Claude Haiku 4.5 等成本最佳化的前沿模型處於同一水準。
價格方面,每 100 萬個輸入 token 為 0.20 美元(約 31 日圓),每 100 萬個輸出 token 為 0.75 美元(約 115 日圓)。發表期間享 80% 折扣,輸入降為 0.04 美元(約 6 日圓),輸出降為 0.15 美元(約 23 日圓)。新增功能包含可調整深度的推理、並行工具呼叫,以及符合 schema 的 JSON 輸出。
※1 美元 = 153 日圓
Inception 指出,這一輪改進來自實際的正式環境,而非追逐跑分。自 Mercury 2 上線以來,使用量成長超過一個數量級,涵蓋搜尋、語音、程式撰寫等對延遲敏感的工作負載。團隊把客戶回饋與真實的失敗案例納入評測集,並據此收斂訓練方向。NVIDIA 方面也表示,這次發表顯示新架構成熟為可上線系統的速度有多快。
真正見效的,是反覆呼叫模型的環節
速度的價值不在單次看得見的回答,而在背後隱藏的數十次模型呼叫。一次搜尋請求可能觸發一連串工作:擬定檢索計畫、改寫查詢、重新排序結果、把事實結構化、摘要來源、驗證答案。只要其中一環變慢,整體就會超出使用者願意等待的時間。
在語音場景中,延遲就是來電者聽到的沉默。開發 AI 電話客服的 OpenCall 改用 Mercury 之後,模型回應延遲的中位數降到約 170 毫秒。該公司表示,最慢的那一段回應從數分鐘降到約 1 秒,中位數也從 0.4 秒降到 0.2 秒以下。
程式輔助工具也是同樣的結構。Augment Code 把 Mercury 用於脈絡壓縮、模型路由與 MCP 工具檢索。將壓縮流程移轉之後,耗時從約 150 秒降到 27 秒,縮短 82%,成本也下降 90%。工具檢索的摘要能在 1 秒內回傳。
Mercury Voice 與 Mercury Router 同步開放預覽
與 Mercury 2.5 一同亮相的還有兩款衍生模型。Mercury Voice 針對語音代理最佳化,首個 token 的回應時間控制在 170 毫秒以內。Mercury Router 則以擴散模型解讀收到的提示,再把任務分派給品質、速度與成本組合最好的模型,候選範圍同時涵蓋開放與封閉模型。
Mercury 系列除了自家 API,也可透過 Baseten 與 OpenRouter 使用。其 API 相容 OpenAI 介面,現有程式碼幾乎不必改動就能替換。企業導入還提供專用容量、自動擴縮、法遵控制以及可設定的資料保留期間。Inception 已著手訓練下一款模型,並表示那將是自家規模最大的一款。
總結
Mercury 2.5 在維持前一代速度與價格結構的前提下,把智慧水準往上推了 40%。每秒 1,107 個 token、260,000 token 的脈絡長度、每 100 萬個輸入 token 0.20 美元的組合,讓它站上與成本最佳化前沿模型相同的起跑線。在搜尋、語音以及程式輔助工具的支援性呼叫中,一次互動往往擴散成數十次模型呼叫,這裡的速度與價格會不斷累積,最後變成體驗上的差距。這次的數據說明,選擇擴散不再等於為了吞吐量而犧牲品質。
