Cognition 於 9 月 10 日推出程式開發模型 SWE-2,稱其為公司至今能力最強的一代。在自家基準 FrontierCode 1.1 Main 上取得 50.0% 的成績,與一般被歸入頂尖梯隊的 Fable 5.1 差距不到 1 分,而要達到同樣水準所需的費用少了 64%。這次發表的主軸並非分數本身,而是能力與費用之間的平衡還能被推到多遠。
把目標從更高分轉向更便宜的同分
整場發表反覆出現的視角,是連結費用與能力的那條界線被往外推了多少。壓縮支出則分數下滑,拉高分數則支出膨脹,Cognition 強調的是這條界線本身被推動了,而不是單獨列出絕對分數。
具體比較如下。在 FrontierCode 1.1 Main 與 DeepSWE 1.1 兩項測試中,SWE-2 在分數與費用兩方面同時勝過上一代 SWE-1.7 以及 Grok 4.6。與 GPT-5.6 Sol、Fable 5、Fable 5.1 分數並列,費用卻明顯更低;面對位居頂端的 GPT-6 Astra,差距收斂到數分之內,費用僅為對方的四分之一。作為參照,Fable 5.1 在中階設定的數據為 50.9%、每項任務 3.28 美元(約 500 日圓)。
※1 美元 = 154 日圓(截至 2026 年 9 月 10 日)
少繞路才是費用下降的來源
費用下降當中最容易理解的一段,是模型處理任務的方式改變了。SWE-2 中階設定的分數高於上一代 SWE-1.7,往返次數卻少了 58%,平均費用低了 81%。
SWE-1.7 有個習慣:動手改程式之前會把周邊讀得很細,使用者回饋指出,即使是簡單的工作它也探索過頭。SWE-2 更擅長判斷程式庫裡哪些部分真正相關,首次實際修改出現在第 18 步(中位數),而 SWE-1.7 需要 48 步,差距超過一半。
判斷品質方面也有變化:能寫出從頭到尾驗證實作的測試;在既定路徑被擋住時願意另尋辦法;被質疑時不再重複原本的主張,而是重新取證推導。官方的整理是,速度提升並沒有以粗糙作為代價。
底座是 2.8 兆參數的 Kimi K3
值得注意的是,SWE-2 並非從零訓練。它的底座是 Moonshot AI 公開的 2.8 兆參數模型 Kimi K3,也是目前權重公開的模型中規模最大的一個。這個起點先前已針對自主寫程式做過強化學習,Cognition 再在其上持續訓練。
這一層加成讓多項基準提升了 5 到 6 分,顯示即便從公開模型出發,費用與能力的界線仍有推動空間。對於沒有財力自行預訓練超大模型的團隊而言,透過聚焦用途的後訓練擠進前段班,也因此看見了可行的路徑。
一次訓練同時打磨所有努力等級
壓低費用的核心機制,是把數個推理努力等級放進同一輪強化學習中一起訓練。
獎勵函數裡加入與單次執行花費成正比的扣分,扣分強度依等級而異。強度並非靠反覆試誤決定,而是對齊底座模型費用能力曲線在該點的斜率。扣分過重時,高等級會表現得像低等級,支出下降、表面獎勵上升,實際上卻沒有任何改善。讓扣分強度與斜率一致,獎勵上升與界線外移才會指向同一件事。
訓練素材同樣在擴張。強化學習環境的數量增加為三倍,加入了在多條指令並存時不會遺失原本工作的訓練,並以 SWE-2 自身的早期檢查點反覆強化評分機制,避免獎勵被鑽漏洞。推論端則改良投機解碼,將接受長度延長 15%,並把抵達的預填請求合併處理,使單張加速卡的吞吐提升 10% 到 20%。
以中國開源模型為底座的部分做了自我檢驗
以公開權重為底座,輸出偏向是躲不掉的問題,Cognition 就此公布了兩項檢驗結果。
其一,以英文、簡體中文、繁體中文分別提交 145 個涉及中國敏感議題的問題,檢視模型是否把官方立場當成自己的立場。SWE-2 整體通過率 98.0%,其中英文 99.8%,簡體中文 95.2%,繁體中文 99.1%。
其二,檢視委託方的身分或請求的語言是否會讓模型更容易接受危險的實作。針對 SWE-2、Kimi K3、GLM 5.3、GPT 5.6、Fable 5.1、Opus 5 六個模型的測試顯示,任何一種設定都沒有產生統計上有意義的差異。
先從 Devin 環境提供
SWE-2 自推出起即可在 Devin Desktop 與命令列版本使用,Devin Web 與 Fusion 隨後陸續開放。它並非作為獨立 API 廣泛銷售,而是替換掉自家程式開發代理產品的核心。由於費用會隨等級大幅變動,實際使用的前提是依工作難度區分等級。
數字該怎麼讀
不過,把這些數字直接照單全收之前,仍有幾點值得確認。作為主要比較軸的 FrontierCode 是 Cognition 自建的基準,對於沒有公開成績的模型,則由該公司自己的評測環境測量。圍繞自身工作負載設計的指標讓自家模型表現亮眼並不令人意外,後續能否被第三方重現才是關鍵。
費用比較也明確以標價為前提。實際支出會隨折扣、用量以及常用等級而變動。先量測自己的工作中哪個等級承擔主力,再進入價格比較,才是務實的順序。
總結
Cognition 於 9 月 10 日推出 SWE-2,在 FrontierCode 1.1 Main 取得 50.0%,與頂尖梯隊的差距控制在 1 分以內,費用則下降 64%。相較上一代,往返次數減少 58%,平均費用下降 81%。它以 Moonshot AI 的 Kimi K3 為底座,透過一次訓練涵蓋所有努力等級的強化學習,把費用與能力的界線往外推。這次發表提出的,是一條不必自建超大模型也能逼近頂尖水準的路線。
