Specific Labs 发布了新的编程测评基准 Real-SWE,题目并非来自公开代码仓库或为测评而专门设计的习题,而是从真实企业授权取得的生产环境代码。在覆盖 8 种模型与执行环境组合、共 640 次运行的测评中,成绩最好的 Anthropic Fable 5.1 解决率也只有 38.8%。

公开代码无法衡量的那部分工作

现有的编程测评大多取材于公开代码仓库,或使用为评测新写的题目。前者有可能早已进入模型的训练数据,后者则往往缺少真实工程中的各种约束。Real-SWE 换了一条路径,直接向企业取得授权,把正在运行的生产代码搬进测评。企业内部写下的代码不存在于公开互联网上,对任何模型而言都天然处于训练分布之外。

被选中的代码库包括一个用户超过 20 万、曾进入 App Store 前 100 名的活动管理服务,一个处理超过 10 万份银行流水的个人金融平台,以及面向企业的 AI 销售平台。它们承载的逻辑都与营收和账单直接相关。例如一道关于发票计税的题目,要求在一次改动中同时处理各商户不同的税务配置、向外部税务服务发起查询、正确处理免税客户,并在发票结清后把销售数据回报给税务机关以便对账。

单道题目涉及的文件数中位数为 11 个,指令长度约 1,742 个字符。指令只说明需要做出什么改动,具体实现细节留给模型自己去代码和周边服务中寻找。测评不让模型单独运行,而是与各家自己的执行环境搭配,例如 Claude Code、Codex CLI、Gemini CLI。每次运行都在隔离沙箱中进行,只暴露该题目所需的服务,涵盖 AWS 模拟器、Docker、Kubernetes、PostgreSQL、Redis、Slack、Intercom 等。

榜首解出的题目也不到 10 题中的 4 题

测评共 10 道题目,8 种模型与执行环境组合各运行 8 次,合计 640 次计分运行。排名如下。

排名 模型 执行环境 解决率 单次运行成本
1 Fable 5.1 Claude Code 38.8% 6.96 美元(约 1,070 日元)
2 GPT-6 Astra Codex CLI 33.8% 4.67 美元(约 710 日元)
3 Gemini 3.8 Flash Gemini CLI 31.2% 2.50 美元(约 380 日元)
4 GLM 5.3 Claude Code 28.8% 5.12 美元(约 780 日元)
5 Grok 4.6 Grok Build 23.8% 3.44 美元(约 530 日元)
5 Muse Spark 1.3 Muse Code 23.8% 2.74 美元(约 420 日元)
7 Kimi K3 Kimi Code 18.8% 3.90 美元(约 600 日元)
8 GPT-5.6 Sol Codex CLI 16.2% 2.65 美元(约 410 日元)

※1 美元 = 153 日元(截至 2026 年 9 月 10 日)

38.8% 意味着榜首配置仍有 10 题中的 6 题没能通过。其中 6 道题目对所有模型的解决率都低于 15%,而一道涉及数据流统计改写的题目,没有任何一个模型通过过一次。对照公开测评中动辄接近 90% 的数字,落差相当明显。

不同模型的失败方式并不相同

把失败的运行分类后,出现频率最高的是遗漏需求,即提交的改动没有满足指令中写明、或从代码中本应能读出的条件。

各模型的分布差异很大。Grok 4.6 的失败中有 67.2% 属于遗漏需求,Kimi K3 也占 53.8%。Gemini 3.8 Flash 则主要败在与既有逻辑的对接错误,占 49.1%;GPT-5.6 Sol 最常见的是在未经验证的前提上继续推进,占 43.3%。榜首的 Fable 5.1 分布相对均匀,遗漏需求 36.7%,对接错误 34.7%。

这个差别在实际工作中不可忽视。遗漏需求这类问题,人工评审相对容易发现;而破坏既有对接的改动,则可能通过测试、直到上线后才暴露。即便解决率相同,需要投入的评审力度也会完全不同。

贵的模型未必更强

单次运行成本落在 2.50 至 6.96 美元之间。Fable 5.1 排名第一,价格也最高;而 Gemini 3.8 Flash 用约三分之一的成本达到 31.2%,从性价比看排序就被反转了。在预算固定的场景中,从榜首往下挑并不自动等于正确答案。

耗时的情况也类似。10 分钟内结束的运行有 71.4% 失败,与耗时更长的运行 73.4% 的失败率几乎没有差距。这些题目并不是多想一会儿就能做对的类型,失败主要集中在一开始就没弄清该做什么。

解读时需要留意的地方

不过,把这些数字直接当成各家实力的定论还为时过早。10 道题目、640 次运行的规模在统计上并不大,名次相邻的模型之间,差距完全可能落在误差范围内。

测评把模型与各自的执行环境绑定评分,也让解读变得复杂。Fable 5.1 与 GLM 5.3 都跑在 Claude Code 上,模型本身的差异与工具的差异没有被分开。加上代码库并不公开,第三方目前无法在相同条件下复现。这些数字由基准的制作方给出,这一前提值得记在心里。

即便如此,如果想判断把智能体接进自家代码库后会发生什么,它仍然比以公开仓库为主的测评更贴近实际。对正在评估落地的团队来说,失败类型的分布比排名本身更值得细读。

总结

Real-SWE 使用从真实企业授权取得的非公开生产代码来测评编程智能体。在 10 道题目、640 次运行中,Fable 5.1 以 38.8% 居首,其后是 GPT-6 Astra 的 33.8% 与 Gemini 3.8 Flash 的 31.2%。6 道题目对所有模型都低于 15%,失败主要集中在遗漏需求。价格更高的模型未必更强,延长运行时间也没有提升解决率。样本规模偏小、无法独立复现是明确的局限,但这些结果有助于解释:为什么公开测评的高分,常常与团队在自家仓库中的体感对不上。