Thinking Machines Lab 發布了第二款模型 Inkling-Small。它採用 MoE 架構,總參數 276B、推論時啟用 12B,約為 7 月中旬登場的旗艦模型 Inkling 的四分之一。與體積越小性能越弱的常識相反,它在推理與程式撰寫的基準測試上超越了母模型。權重以 Apache 2.0 授權開放,量化版本可在單張 GPU 上執行。不過在事實知識方面,它明顯出現退步。

體積只有四分之一,卻站在同一個智慧級距

Inkling-Small 是 42 層的純解碼器 Transformer,前饋部分採用稀疏 MoE(Mixture of Experts,專家混合)。總參數 276B,每個 token 只啟用 12B。每個 token 從 256 個路由專家中挑出 6 個,再加上對所有 token 都生效的 2 個共享專家。訓練使用了 NVIDIA 的 GB300 NVL72 系統。

作為對照,旗艦模型 Inkling 的總參數為 975B、啟用 41B,因此 Inkling-Small 在兩項數字上都只有約三分之一。即便如此,第三方評測機構 Artificial Analysis 給出的 Inkling-Small 智慧指數為 40,僅比 Inkling 的 41 低 1 分。該機構表示,在同等規模及更小的開放權重模型中,沒有分數更高的。

有一處細節值得在導入前確認:官方部落格指出脈絡長度最高可達 100 萬 token,而 Artificial Analysis 記載的是 256K token。上限似乎會因提供管道而不同。

Thinking Machines Lab 是由 OpenAI 前 CTO Mira Murati 在舊金山創辦的研究機構。這款第二號模型距離 Inkling 發布僅約兩週。

較晚開始訓練反而成了優勢

小模型能夠反超母模型,關鍵在於訓練的先後順序。依官方說法,Inkling-Small 的訓練晚於大模型啟動,因而有餘裕重新檢討預訓練的資料配比與機器學習流程。

此外,團隊對中途的檢查點進行後訓練,其中一部分採用以 Inkling 為教師的同策略蒸餾。在此基礎上,又花了兩週繼續擴大代理式程式撰寫的強化學習規模。效能的提升來自訓練程序的重組,而非增加參數量。

強項超越母模型,知識面則落後

把數字攤開來看,進步與退步的領域相當分明。

推理方面,Humanity's Last Exam(純文字)為 31.6%,高於 Inkling 的 29.7%。GPQA Diamond 是 89.5 對 87.2,ARC-AGI-2 是 40.1 對 36.5。程式撰寫方面,SWEBench Verified 為 80.2 對 77.6,Terminal Bench 2.1 為 64.7 對 63.8。衡量工具操作的 Toolathlon Verified 則是 54.4 對 45.5,拉開近 10 個百分點。

退步的是事實知識。SimpleQA Verified 只有 20.6%,不到 Inkling 43.9% 的一半。金融任務 τ³-Banking 也以 15.5 對 23.7 落後。在 Artificial Analysis 的統計中,AA-Omniscience 指數為負 9.0,而 Inkling 為 2.1,代表答錯多於答對。不過該機構指出,原因並非幻覺增加,而是正確率本身只有 31%;其幻覺率反而低於 Inkling,為 57%。

換句話說,思考能力與使用工具的能力都保留了下來,被削去的只有記憶量。若在設計上透過搜尋或 RAG 從外部提供知識,影響有限;若仰賴模型本身的記憶,影響就會浮現。

輸出 token 的用法也相當節省

輸出 token 的規模同樣值得一提。在 Artificial Analysis 智慧指數的單一任務中,Inkling-Small 平均輸出約 24,000 個 token,略少於 Inkling 的約 25,000 個。同一智慧級距的 DeepSeek V4 Flash(max)約為 45,000,GPT-5.4 mini(xhigh)約為 78,000,相較之下它相當簡潔。

在衡量長時間作業的 AA-Briefcase 上,它取得 917 Elo,超過 Inkling 的 839。但 Artificial Analysis 提醒,兩者的評分表通過率幾乎相同(20% 對 19%),因此比較像是輸出的呈現方式變好,而非正確性大幅提升。它完成任務的平均輪數為 34,不到 Inkling 81 輪的一半。

音訊與影像持平,自架部署起跳 180GB

多模態方面大致維持 Inkling 的水準。無編碼器的架構沒有改變:影像被切成 40×40 像素的區塊,經四層 hMLP 轉換;音訊則以 dMel 頻譜圖的形式處理。MMMU Pro 為 74.0%,圖表理解的 CharXiv RQ 為 77.4%,若讓模型用 Python 進行裁切與放大,可提升到 81.3%。音訊側 MMAU 為 77.0%,VoiceBench 為 90.1%。

自架部署的條件也已公開。模型卡指出,BF16 檢查點需要合計 600GB 以上的顯示記憶體,相當於 4 張 NVIDIA B300 或 8 張 H200。NVFP4 版本把門檻降到 180GB,可在單張 B300(SM100 以上)以 W4A4 執行,或在兩張 H200 上以 W4A16 執行。支援的執行環境包括 SGLang、vLLM、TokenSpeed、Unsloth 與 Hugging Face。

讓 276B 級距的模型進入單卡射程,是一項不小的變化。不過前提仍是能租到一張 B300,因此這並不是在筆電上執行的量級。

安全性評測與取得方式

安全性的後訓練沿用了 Inkling 的做法,發布前的內部評估與外部夥伴紅隊測試也同樣執行。衡量能否拒絕明確有害要求的 StrongREJECT 為 98.4%。在涵蓋犯罪、暴力與軍民兩用風險的 FORTRESS 中,對抗性題目的拒答率為 71.6%,無害題目的作答率為 96.9%。該實驗室的結論是,相對於既有的開放權重生態並未帶來實質風險增量,同時建議面向消費者的部署再疊加下游的內容審核。

權重在 Hugging Face 上以 Apache 2.0 授權散布。模型也可在該公司的微調平台 Tinker 上使用,並能透過 Tinker Playground 進行文字、影像與音訊對話。Inkling 與 Inkling-Small 都設有限時折扣。

總結

Inkling-Small 以總參數 276B、啟用 12B 的組合,在推理與程式撰寫上超越了體積近四倍的母模型。權重採 Apache 2.0 開放,NVFP4 版本可在 180GB 顯示記憶體中執行。但另一方面,事實知識的分數下滑超過一半,因此並不適合只仰賴模型記憶的用法。較穩妥的做法是,以搭配搜尋與工具為前提,在自己的任務上重新測量後再做判斷。