Specific Labs 发布了新的编程测评基准 Real-SWE,题目并非来自公开代码仓库或为测评而专门设计的习题,而是从真实企业授权取得的生产环境代码。在覆盖 8 种模型与执行环境组合、共 640 次运行的测评中,成绩最好的 Anthropic Fable 5.1 解决率也只有 38.8%。
公开代码无法衡量的那部分工作
现有的编程测评大多取材于公开代码仓库,或使用为评测新写的题目。前者有可能早已进入模型的训练数据,后者则往往缺少真实工程中的各种约束。Real-SWE 换了一条路径,直接向企业取得授权,把正在运行的生产代码搬进测评。企业内部写下的代码不存在于公开互联网上,对任何模型而言都天然处于训练分布之外。
被选中的代码库包括一个用户超过 20 万、曾进入 App Store 前 100 名的活动管理服务,一个处理超过 10 万份银行流水的个人金融平台,以及面向企业的 AI 销售平台。它们承载的逻辑都与营收和账单直接相关。例如一道关于发票计税的题目,要求在一次改动中同时处理各商户不同的税务配置、向外部税务服务发起查询、正确处理免税客户,并在发票结清后把销售数据回报给税务机关以便对账。
单道题目涉及的文件数中位数为 11 个,指令长度约 1,742 个字符。指令只说明需要做出什么改动,具体实现细节留给模型自己去代码和周边服务中寻找。测评不让模型单独运行,而是与各家自己的执行环境搭配,例如 Claude Code、Codex CLI、Gemini CLI。每次运行都在隔离沙箱中进行,只暴露该题目所需的服务,涵盖 AWS 模拟器、Docker、Kubernetes、PostgreSQL、Redis、Slack、Intercom 等。
榜首解出的题目也不到 10 题中的 4 题
测评共 10 道题目,8 种模型与执行环境组合各运行 8 次,合计 640 次计分运行。排名如下。
| 排名 | 模型 | 执行环境 | 解决率 | 单次运行成本 |
|---|---|---|---|---|
| 1 | Fable 5.1 | Claude Code | 38.8% | 6.96 美元(约 1,070 日元) |
| 2 | GPT-6 Astra | Codex CLI | 33.8% | 4.67 美元(约 710 日元) |
| 3 | Gemini 3.8 Flash | Gemini CLI | 31.2% | 2.50 美元(约 380 日元) |
| 4 | GLM 5.3 | Claude Code | 28.8% | 5.12 美元(约 780 日元) |
| 5 | Grok 4.6 | Grok Build | 23.8% | 3.44 美元(约 530 日元) |
| 5 | Muse Spark 1.3 | Muse Code | 23.8% | 2.74 美元(约 420 日元) |
| 7 | Kimi K3 | Kimi Code | 18.8% | 3.90 美元(约 600 日元) |
| 8 | GPT-5.6 Sol | Codex CLI | 16.2% | 2.65 美元(约 410 日元) |
※1 美元 = 153 日元(截至 2026 年 9 月 10 日)
38.8% 意味着榜首配置仍有 10 题中的 6 题没能通过。其中 6 道题目对所有模型的解决率都低于 15%,而一道涉及数据流统计改写的题目,没有任何一个模型通过过一次。对照公开测评中动辄接近 90% 的数字,落差相当明显。
不同模型的失败方式并不相同
把失败的运行分类后,出现频率最高的是遗漏需求,即提交的改动没有满足指令中写明、或从代码中本应能读出的条件。
各模型的分布差异很大。Grok 4.6 的失败中有 67.2% 属于遗漏需求,Kimi K3 也占 53.8%。Gemini 3.8 Flash 则主要败在与既有逻辑的对接错误,占 49.1%;GPT-5.6 Sol 最常见的是在未经验证的前提上继续推进,占 43.3%。榜首的 Fable 5.1 分布相对均匀,遗漏需求 36.7%,对接错误 34.7%。
这个差别在实际工作中不可忽视。遗漏需求这类问题,人工评审相对容易发现;而破坏既有对接的改动,则可能通过测试、直到上线后才暴露。即便解决率相同,需要投入的评审力度也会完全不同。
贵的模型未必更强
单次运行成本落在 2.50 至 6.96 美元之间。Fable 5.1 排名第一,价格也最高;而 Gemini 3.8 Flash 用约三分之一的成本达到 31.2%,从性价比看排序就被反转了。在预算固定的场景中,从榜首往下挑并不自动等于正确答案。
耗时的情况也类似。10 分钟内结束的运行有 71.4% 失败,与耗时更长的运行 73.4% 的失败率几乎没有差距。这些题目并不是多想一会儿就能做对的类型,失败主要集中在一开始就没弄清该做什么。
解读时需要留意的地方
不过,把这些数字直接当成各家实力的定论还为时过早。10 道题目、640 次运行的规模在统计上并不大,名次相邻的模型之间,差距完全可能落在误差范围内。
测评把模型与各自的执行环境绑定评分,也让解读变得复杂。Fable 5.1 与 GLM 5.3 都跑在 Claude Code 上,模型本身的差异与工具的差异没有被分开。加上代码库并不公开,第三方目前无法在相同条件下复现。这些数字由基准的制作方给出,这一前提值得记在心里。
即便如此,如果想判断把智能体接进自家代码库后会发生什么,它仍然比以公开仓库为主的测评更贴近实际。对正在评估落地的团队来说,失败类型的分布比排名本身更值得细读。
总结
Real-SWE 使用从真实企业授权取得的非公开生产代码来测评编程智能体。在 10 道题目、640 次运行中,Fable 5.1 以 38.8% 居首,其后是 GPT-6 Astra 的 33.8% 与 Gemini 3.8 Flash 的 31.2%。6 道题目对所有模型都低于 15%,失败主要集中在遗漏需求。价格更高的模型未必更强,延长运行时间也没有提升解决率。样本规模偏小、无法独立复现是明确的局限,但这些结果有助于解释:为什么公开测评的高分,常常与团队在自家仓库中的体感对不上。
