Specific Labsが、実在する企業の非公開コードを題材にした新しいコーディング評価「Real-SWE」を公開しました。公開リポジトリや評価用に作った問題ではなく、稼働中の製品のコードを企業から借り受けて課題を組んでいるのが特徴です。8つのモデルと専用ツールの組み合わせで640回試した結果、最も成績の良かったAnthropicのFable 5.1でも解決率は38.8パーセントにとどまりました。

公開されたコードでは測れない仕事を測る

既存のコーディング評価の多くは、公開リポジトリの課題か、評価のために新しく作った問題を使います。前者はモデルが学習時にすでに読んでいる可能性があり、後者は実際の業務で発生する制約が抜け落ちがちです。Real-SWEはここを突いて、企業から利用許諾を得た本番コードを持ち込みました。企業内で書かれたコードはインターネット上に存在せず、どのモデルも学習していない、いわば分布の外側にある素材です。

課題として選ばれたコードベースは、利用者20万人超でApp Storeの上位100位に入ったイベント管理サービス、銀行明細を10万件以上処理する個人向けフィンテック基盤、営業支援のAI基盤などです。いずれも実際に売上や請求に直結する処理を含みます。たとえば請求書の課税計算を直す課題では、事業者ごとに異なる税率の扱い、外部の税務APIへの問い合わせ、免税顧客の扱い、確定後の売上申告までを1つの変更で通す必要があります。

変更が及ぶファイル数は課題の中央値で11、指示文は1,742文字程度です。指示は必要な変更を述べるだけで、実装の詳細はコードや周辺のサービスを読んで自分で見つける前提になっています。評価ではモデルを単体で走らせるのではなく、Claude Code、Codex CLI、Gemini CLIといった各社の実行環境と組み合わせた状態で測ります。AWSのエミュレータ、Docker、Kubernetes、PostgreSQL、Redis、Slack、Intercomなど、課題ごとに必要なサービスだけが用意された隔離環境で動かす形です。

首位でも10問中4問に届かない

評価は10課題、8つのモデルと実行環境の組み合わせで、それぞれ8回ずつ実行した640回分の結果を平均しています。順位は次の通りです。

順位 モデル 実行環境 解決率 1回あたりの費用
1 Fable 5.1 Claude Code 38.8パーセント 6.96ドル(約1,070円)
2 GPT-6 Astra Codex CLI 33.8パーセント 4.67ドル(約710円)
3 Gemini 3.8 Flash Gemini CLI 31.2パーセント 2.50ドル(約380円)
4 GLM 5.3 Claude Code 28.8パーセント 5.12ドル(約780円)
5 Grok 4.6 Grok Build 23.8パーセント 3.44ドル(約530円)
5 Muse Spark 1.3 Muse Code 23.8パーセント 2.74ドル(約420円)
7 Kimi K3 Kimi Code 18.8パーセント 3.90ドル(約600円)
8 GPT-5.6 Sol Codex CLI 16.2パーセント 2.65ドル(約410円)

※1ドル153円換算(2026年9月10日時点)

首位のFable 5.1でも、10課題のうち通せたのは4課題に届かない計算になります。さらに10課題のうち6課題は全モデルの解決率が15パーセントを下回り、集計処理の書き換えを求める課題にいたっては、どのモデルも1度も通せませんでした。公開ベンチマークで9割前後の数字を見慣れていると、落差はかなり大きく感じられます。

つまずき方はモデルごとに違う

失敗した試行を分類すると、全体で最も多いのは要件の取りこぼしでした。指示に書かれている、あるいはコードを読めば分かるはずの条件を満たさないまま提出してしまうパターンです。

内訳はモデルごとにかなり違います。Grok 4.6は失敗のうち67.2パーセントが要件の取りこぼしで、Kimi K3も53.8パーセントがこれに当たります。一方でGemini 3.8 Flashは既存処理との接続の誤りが49.1パーセントを占め、GPT-5.6 Solは確認せずに前提を置いてしまう失敗が43.3パーセントと目立ちました。首位のFable 5.1は要件の取りこぼしが36.7パーセント、接続の誤りが34.7パーセントと、比較的分散しています。

この差は実務では無視できません。要件を落とすタイプの失敗は人がレビューで拾いやすい一方、既存処理との接続を壊すタイプは、テストを通り抜けて本番で表面化することがあります。同じ解決率でも、どちらの失敗が多いかで運用の手当ては変わってきます。

高いモデルが強いとは限らない

費用の欄を見ると、1回あたりの実行コストは2.50ドルから6.96ドルの幅に収まります。最高額のFable 5.1が首位ではあるものの、Gemini 3.8 Flashは3分の1近い費用で31.2パーセントを出しており、費用対効果では逆転します。予算が決まっている場面では、上から順に選ぶのが最適とは限らないという材料です。

時間についても同じことが言えます。10分未満で終わった試行の71.4パーセントが失敗しており、それより長くかかった試行の失敗率73.4パーセントとほとんど変わりませんでした。時間をかければ通るという性質の課題ではなく、そもそも何をすべきかを掴み損ねていることが失敗の中心だと読めます。

読み方に注意したい点

一方で、この数字をそのまま各社の実力差として受け取るのは早計です。課題は10問、試行は640回で、統計として大きな規模ではありません。順位の近いモデル同士の差が誤差の範囲に収まる可能性は十分にあります。

評価がモデル単体ではなく実行環境との組み合わせで行われている点も、解釈を難しくします。Fable 5.1とGLM 5.3はいずれもClaude Code上で走っており、モデルの差と道具の差が分けられていません。加えてコードベースは非公開のため、第三者が同じ条件で追試することは現状できません。作った側が示した数字であるという前提は、頭の隅に置いておく必要があります。

それでも、自社のコードで同じことをやらせたときに何が起きるかを考える材料としては、公開リポジトリ中心の評価より実態に近いはずです。導入を検討している立場であれば、解決率の順位よりも、失敗の内訳のほうが読み応えがあります。

まとめ

Real-SWEは、企業から借りた非公開の本番コードを使ってコーディングエージェントを測る評価です。10課題、640回の試行で首位はFable 5.1の38.8パーセント、以下GPT-6 Astraが33.8パーセント、Gemini 3.8 Flashが31.2パーセントと続きました。6課題は全モデルが15パーセントを下回り、失敗の中心は要件の取りこぼしです。費用の高いモデルが必ず強いわけではなく、時間をかけても解決率は上がりませんでした。規模の小ささと追試のできなさという限界はありますが、公開リポジトリでの高スコアと現場の感触が食い違う理由を説明する材料にはなります。