由前 OpenAI 研究員迪歐戈·阿爾梅達帶領的 TypeSafe AI,在當地時間 9 月 15 日發表了新的模型類別「System One Models」,以及該類別的首款模型「Jev」。它的設計相當果斷:完全不產生文字,只依照事先定義好的結構回傳判斷,端到端的回應時間落在 0.07 秒到 0.5 秒之間。早期存取的申請也在同一天開放。

不是聊天的延伸,而是在軟體內部使用的判斷

阿爾梅達說,過去 4 年他反覆思考的問題是:模型在對話上早就超越人類,為什麼自動化卻沒有跟著到來。他在 OpenAI 參與過讓模型遵循指示、與人對話的方法研究,這些成果構成了 ChatGPT 的基礎。即使如此,他逐漸不再相信 AGI 就在聊天的下一站,於是花了 2 年在隱形狀態下轉往另一個方向。

由此得出的答案,是名為 System One Models 的新模型分類。名稱取自丹尼爾·康納曼的《快思慢想》,對應書中快速直覺的系統 1 與緩慢審慎的系統 2 之分。現有的 LLM 較偏向系統 2 的角色,而這個類別則完全轉向高速、結構化的判斷。

首款模型 Jev 的名字來自經濟學家威廉·斯坦利·傑文斯。這個命名呼應蒸汽機效率提升反而推升煤炭需求的悖論,寄託了這樣一種判讀:智慧的單價每下降一個數量級,用途就會擴大好幾個數量級。

放棄文字,換來型別保證與信賴度

Jev 設計中最果斷的一點,是決定不輸出字串。常見的 LLM 逐一產生 token,累積起來成為聊天回覆或程式碼。Jev 則依照事先定義的 schema,把可選項與機率平行地一次輸出。TypeSafe AI 把它形容為一種函式呼叫:輸入非結構化的狀態,輸出帶型別的機率判斷。

在這種形態下,輸出跑到 schema 之外在原理上不會發生。工具呼叫裡混進不存在的函式名稱、本該放數值的欄位塞進一段文字,這類事故就此消失。此外,每一個判斷都附帶經過校準的信賴度。TypeSafe AI 的問題意識是:就算一項任務模型能解對 95%,若它無法主動申報剩下的 5%,這項任務就無法交給自動化。

訓練方法也是專門打造的。它沒有採用以人類偏好為獎勵的 RLHF,也沒有採用以可驗證答案為獎勵的 RLVR,而是使用以機率誠實度為獎勵的 RLCD(Reinforcement Learning for Calibrated Decisions)。設想的用途包含分類、路由、擷取與評分,也就是手寫 if 條件容易變得脆弱的那些環節。為 LLM 的輸出評分、或當成護欄使用,也被列在其中。

每百萬輸入 token 0.042 美元,輸出免費

價格水準與既有模型根本不在同一個刻度上。Jev 的輸入價格為每百萬 token 0.042 美元(約 6 日圓),輸出 token 免費。TypeSafe AI 解釋,之所以標為 0 美元,是因為便宜到不值得計量。依該公司的比較,現有 LLM 的輸入價格為每百萬 token 0.20 美元(約 31 日圓)到 10 美元(約 1,550 日圓),輸出大致是輸入的 5 倍。

※1 美元 = 155 日圓

低價的依據,在於輸出的做法本身被改寫了。放棄逐一吐出 token 的處理、改成平行一次完成,硬體因此不必空轉。該公司把這種替換形容為與 Transformer 取代 RNN 同一類型的更替。

回應 0.07 到 0.5 秒,快到能玩 DOOM

速度差距更為極端。依 TypeSafe AI 的說法,前沿 LLM 的端到端回應需要 3 秒到 329 秒,而 Jev 在 0.07 秒到 0.5 秒內回傳。前者用來跟人對話還算堪用,一旦嵌進程式碼,等待時間就直接成了瓶頸。

作為直觀的示範,該公司公開了讓 Jev 玩經典遊戲 DOOM 的影片。它每秒發出約 10 次查詢,玩上 1 小時的費用約 7 美元(約 1,090 日圓)。負責這個示範的工程師原本擔心每秒 10 次的頻率,團隊其他成員卻覺得比想像中便宜。要說明的是,Jev 判斷所依據的並不是遊戲畫面影像,而是結構化的遊戲狀態資料。

另一個示範,是從一篇 Wikipedia 條目出發,只沿著途中遇到的連結抵達另一篇條目。每一步都可能得在數百到數千個連結之間做選擇,因此除了速度之外,在選項極多時不會憑空生出不存在的連結這項優勢同樣關鍵。該公司註明,這個示範中各模型都跑在未開啟推理的高速模式下,因此速度差距相對溫和。

193 倍這個數字該怎麼讀

官方網站標出的 193.6 倍更快、444.6 倍更省,來自該公司新建的工作流評測。做法是給每個模型同樣的工作流,再以最昂貴的外部模型的預測作為基準機率來比較。基準取 GPT-6 Astra 與 Fable 5.1 的平均值,TypeSafe AI 也自行承認,這種取法會對 OpenAI 與 Anthropic 的模型有利。

這份坦率貫穿全文。工作流由該公司自己的模型能力團隊搭建,因此可能殘留偏差;速度量測是從位於美國西岸的筆電上執行的;價格是否受到補貼,只能靠長期才能證明。型別錯誤 0% 這個數值也不是實測,而是因為 schema 比對有保證,所以理論上可以標為 0。

反過來看,這裡呈現的優勢全部出自該公司的自我評測,目前還沒有第三方重現。雖然公開的評測網站可以追查細節,但 193 倍更適合理解為條件齊備時的上限,而不是實際業務中能直接拿到的數值。

總結

TypeSafe AI 發表的 Jev 捨棄了文字生成,只回傳結構化判斷,走向與既有 LLM 不同的方向。每百萬輸入 token 0.042 美元且輸出免費、回應 0.07 秒到 0.5 秒、原理上不會產出 schema 之外的內容,這些是它並列的特徵。193.6 倍更快的數字建立在自我評測上,但「為了在程式碼內部使用而設計模型」這個思路本身,看起來很可能擴散到其他陣營。早期存取正在受理登記,等待名單的邀請也在陸續推進。