OpenAIは、AIのコーディング能力を測るベンチマークとして広く使われている「SWE-Bench Pro」を詳細に監査し、全体の約30パーセントのタスクに欠陥があると推計したことを明らかにしました[1]。同社はかつてこのベンチマークへの移行を推奨していましたが、今回の結果を受けてその推奨を撤回しています[1]。AIモデルの実力を正しく測る難しさをあらためて示す発表です。
SWE-Bench Proとは何か、なぜ監査したのか
SWE-Bench Proは、実在するソフトウェアのリポジトリ(コードの保管庫)から機能変更の履歴を抽出し、AIモデルに「新しいテストに合格する実装を、既存機能を壊さずに書けるか」を問うベンチマークです[1]。より長い作業時間と現実的な課題でエージェント的なコーディング能力を測る設計で、公開されている731タスクでは、最先端モデルの合格率がわずか8か月で23.3パーセントから80.3パーセントへと急伸していました[1]。
OpenAIがこの監査に乗り出した背景には、前例があります。同社は以前、定番ベンチマークだった「SWE-bench Verified」に設計上の問題やデータ汚染(学習データに答えが混入する問題)があり、もはや有意義な指標にならないと指摘し、その際に代替としてSWE-Bench Proへの移行を勧めていました[1]。今回はその移行先に対して、同じ手法で品質チェックを行った形です[1]。
評価結果はOpenAI自身の安全性や展開判断(Preparedness Frameworkに基づく意思決定)にも使われるため、指標そのものが壊れていると能力を見誤り、研究の優先順位にも影響が出るとOpenAIは説明しています[1]。
AIエージェントと人間エンジニアの二段構えで監査
監査ではまず、モデルへの指示文・モデルの解答・採点用テストを自動フィルターで解析し、問題がありそうな286タスクを抽出しました[1]。次に、この抽出分をCodexベースの調査エージェントが深掘りします。エージェントはリポジトリと実行環境にアクセスでき、テストを走らせたり、モデルがつまずきやすい箇所を調べたりしたうえで、最終判断は研究者が下しました[1]。
並行して、経験豊富なソフトウェアエンジニアによる人手のレビューも実施されました。1つのタスクにつき5人のエンジニアが独立して判定し、意見が割れたものや確信度の低いものはさらに精査へ回す運用です[1]。
見つかった欠陥は主に4種類に分類されます[1]。指示にない実装の詳細までテストが強制し、機能的には正しい解答を不正解にしてしまう「過度に厳格なテスト」、隠しテストが要求する仕様が指示文から読み取れない「不十分な指示文」、求めた機能を十分に検査せず不完全な修正でも合格してしまう「カバレッジの低いテスト」、そしてテストの要求と矛盾する方向へモデルを誘導する「誤解を招く指示文」です[1]。
興味深いのは、人間のレビュアーのほうがエージェントよりもタスクを「破損」と判定しやすかった点です。両者の判定はエージェントが指摘したカテゴリーの74パーセントで重なりましたが、「カバレッジの低いテスト」は人間側が9.4パーセントのタスクで最多の問題として選んだのに対し、エージェント側は4.1パーセントにとどまりました[1]。フラグの立ったタスクのうち「壊れていない」が人間の最多票になったものは1件もなかったといいます[1]。
推奨を撤回、コミュニティに新たなベンチマーク作りを呼びかけ
OpenAIは一連の結果から、SWE-Bench Proの約30パーセントのタスクが破損していると推計し、モデル開発者に対して結果を慎重に検討するよう助言しています[1]。あわせて、同ベンチマークの採用を勧めた以前の推奨を撤回しました[1]。
欠陥が生まれる構造的な理由についても言及があります。オープンソースの課題やプルリクエスト(変更の提案)は、もともと人間同士の共同作業のために書かれたもので、問題の説明・マージされたコード・単体テストが、モデル評価に適した独立したタスクとしてきれいに揃うとは限りません[1]。特にプルリクエストに含まれるテストは、特定の変更を検証する目的で書かれるため、実装方法を問わない汎用的な合格基準にはなりにくいと指摘しています[1]。
一方で、モデルの能力向上により、こうした評価の欠陥を大規模に洗い出すこと自体は以前より容易になっているとも述べています[1]。OpenAIは、経験豊富なソフトウェア開発者がモデル評価のために専用に構築する、新しいベンチマークの開発をコミュニティに呼びかけました[1]。
まとめ
OpenAIの監査により、SWE-Bench Proの約30パーセントのタスクに欠陥があると推計され、同社は以前の採用推奨を撤回しました[1]。合格率の急上昇が必ずしも実力の向上だけを意味しないという事実は、ベンチマークの数字を追う私たちにとっても重い教訓です。AIのコーディング能力を正しく測る「壊れていないものさし」をどう作るかが、業界全体の課題になりそうです。
出典:https://openai.com/index/separating-signal-from-noise-coding-evaluations
