Specific Labs 發布了新的程式開發評測基準 Real-SWE,題目並非取自公開程式碼儲存庫,也不是為了評測而另外設計的練習題,而是向真實企業取得授權的正式營運程式碼。在涵蓋 8 種模型與執行環境組合、合計 640 次執行的評測中,表現最好的 Anthropic Fable 5.1 解題率也只有 38.8%。
公開程式碼量不到的那一段工作
現行的程式評測多半取材自公開儲存庫,或使用為評測新寫的題目。前者有可能早已進入模型的訓練資料,後者則往往少了真實工程現場的種種限制。Real-SWE 改走另一條路,直接向企業取得授權,把正在運作的營運程式碼搬進評測。企業內部寫下的程式碼並不存在於公開網路上,對任何模型而言都天然落在訓練分布之外。
被選中的程式碼庫包括一個使用者超過 20 萬、曾進入 App Store 前 100 名的活動管理服務,一個處理超過 10 萬份銀行對帳單的個人金融平台,以及面向企業的 AI 業務平台。它們承載的邏輯都與營收和帳單直接相關。舉例來說,其中一道發票課稅的題目,要求在一次修改中同時處理各商家不同的稅務設定、向外部稅務服務發出查詢、正確處理免稅客戶,並在發票結清後把銷售資料回報給稅務機關以利對帳。
單一題目牽動的檔案數中位數為 11 個,指示文長度約 1,742 個字元。指示只說明需要做出什麼樣的修改,實作細節留給模型自行從程式碼與周邊服務中找出。評測不讓模型單獨執行,而是搭配各家自己的執行環境,例如 Claude Code、Codex CLI、Gemini CLI。每次執行都在隔離沙箱中進行,只開放該題目所需的服務,涵蓋 AWS 模擬器、Docker、Kubernetes、PostgreSQL、Redis、Slack、Intercom 等。
榜首解出的題目也不到 10 題中的 4 題
評測共 10 道題目,8 種模型與執行環境組合各執行 8 次,合計 640 次計分執行。排名如下。
| 排名 | 模型 | 執行環境 | 解題率 | 單次執行成本 |
|---|---|---|---|---|
| 1 | Fable 5.1 | Claude Code | 38.8% | 6.96 美元(約 1,070 日圓) |
| 2 | GPT-6 Astra | Codex CLI | 33.8% | 4.67 美元(約 710 日圓) |
| 3 | Gemini 3.8 Flash | Gemini CLI | 31.2% | 2.50 美元(約 380 日圓) |
| 4 | GLM 5.3 | Claude Code | 28.8% | 5.12 美元(約 780 日圓) |
| 5 | Grok 4.6 | Grok Build | 23.8% | 3.44 美元(約 530 日圓) |
| 5 | Muse Spark 1.3 | Muse Code | 23.8% | 2.74 美元(約 420 日圓) |
| 7 | Kimi K3 | Kimi Code | 18.8% | 3.90 美元(約 600 日圓) |
| 8 | GPT-5.6 Sol | Codex CLI | 16.2% | 2.65 美元(約 410 日圓) |
※1 美元 = 153 日圓(截至 2026 年 9 月 10 日)
38.8% 意味著榜首組合仍有 10 題中的 6 題沒能過關。其中 6 道題目對所有模型的解題率都低於 15%,而一道涉及數據串流統計改寫的題目,沒有任何一個模型通過過一次。對照公開評測動輒接近 90% 的數字,落差相當明顯。
不同模型的失敗方式並不相同
把失敗的執行加以分類後,出現頻率最高的是遺漏需求,也就是交出的修改沒有滿足指示中寫明、或從程式碼中本應讀得出來的條件。
各模型的分布差異很大。Grok 4.6 的失敗中有 67.2% 屬於遺漏需求,Kimi K3 也占 53.8%。Gemini 3.8 Flash 則主要敗在與既有邏輯的銜接錯誤,占 49.1%;GPT-5.6 Sol 最常見的是在未經驗證的前提上繼續推進,占 43.3%。榜首的 Fable 5.1 分布相對平均,遺漏需求 36.7%,銜接錯誤 34.7%。
這個差別在實務上不可忽視。遺漏需求這類問題,人工審查相對容易抓到;而破壞既有銜接的修改,則可能通過測試、直到上線後才浮現。即使解題率相同,需要投入的審查力道也會完全不同。
貴的模型未必更強
單次執行成本落在 2.50 至 6.96 美元之間。Fable 5.1 排名第一,價格同時也最高;而 Gemini 3.8 Flash 用約三分之一的成本達到 31.2%,從性價比來看排序就被翻轉了。在預算固定的場合,從榜首往下挑並不自動等於正確答案。
耗時的情況也一樣。10 分鐘內結束的執行有 71.4% 失敗,與耗時較長的執行 73.4% 的失敗率幾乎沒有差距。這些題目並不是多想一會兒就能做對的類型,失敗主要集中在一開始就沒弄清楚該做什麼。
解讀時需要留意的地方
不過,把這些數字直接當成各家實力的定論仍然言之過早。10 道題目、640 次執行的規模在統計上並不大,名次相鄰的模型之間,差距完全可能落在誤差範圍內。
評測把模型與各自的執行環境綁在一起計分,也讓解讀變得複雜。Fable 5.1 與 GLM 5.3 都跑在 Claude Code 上,模型本身的差異與工具的差異並沒有被分開。加上程式碼庫並未公開,第三方目前無法在相同條件下重現。這些數字由基準的製作方提出,這個前提值得放在心上。
即便如此,若想判斷把代理程式接進自家程式碼庫後會發生什麼事,它仍然比以公開儲存庫為主的評測更貼近實際。對正在評估導入的團隊而言,失敗類型的分布比排名本身更值得細讀。
總結
Real-SWE 使用向真實企業取得授權的非公開營運程式碼來評測程式開發代理。在 10 道題目、640 次執行中,Fable 5.1 以 38.8% 居首,其後是 GPT-6 Astra 的 33.8% 與 Gemini 3.8 Flash 的 31.2%。6 道題目對所有模型都低於 15%,失敗主要集中在遺漏需求。價格較高的模型未必更強,拉長執行時間也沒有提升解題率。樣本規模偏小、無法獨立重現是明確的限制,但這些結果有助於說明:為什麼公開評測的高分,常常與團隊在自家儲存庫中的實際感受對不上。
