OpenAIは、計算生物学の研究でAIエージェントがどこまで的確な判断を下せるかを測定する新しいベンチマーク「GeneBench-Pro」を公開しました[1]。ゲノミクスや定量生物学、橋渡し医療にまたがる129問で構成され、単なる知識の暗記や定型作業ではなく、曖昧なデータからどの分析手法を選ぶかといった研究者ならではの判断を試します。最新モデルでも正答率は3割前後にとどまり、AIが科学研究の現場で人間の専門家を補佐できるかを見極める指標として注目されます。

知識ではなく「正解への道筋」を問う

GeneBench-Proが測ろうとしているのは、事実を答える力ではありません。科学データは説明書付きで届くわけではなく、研究者はあるパターンが本物の生物学的シグナルなのか単なるノイズなのかを見極め、データがその問いに答えられるのかを判断し、得られた結果から次の一手を決める必要があります[1]。OpenAIはこうした一連の判断を「リサーチ・テイスト(研究の勘所)」と呼び、その良し悪しを評価対象に据えました。

各問題では、現実的で雑然としたデータセットと簡単な実験的背景、そして下流の意思決定に紐づく目標値がモデルに与えられます。モデルはデータを探索し、適切な分析手法を選び、試行錯誤を重ねたうえで最終的な答えを出さなければなりません。実際の解析環境としては、PythonやPLINK 2.0といった標準的なバイオインフォマティクスのツール一式が用意された隔離ワークスペースが提供されます[1]。

129問を人工的に設計し、専門家が検証

既存のベンチマークでは、過去の雑然としたデータを使うと「正解への道筋」が一意に定まらず、評価が作問者の恣意的な選択を反映してしまう問題がありました。GeneBench-Proはこれを避けるため、各問題をデータ生成の因果構造ごと人工的にシミュレーションして作成しています[1]。これにより問題の難易度を調整でき、分析上の妥当な解釈の違いがあっても許容範囲の数値に収まるよう設計し、もっともらしいが誤った解析はきちんと不正解になることを確認したとしています。

さらにOpenAIは、129問のうち82問を大学院生やポスドク、企業の研究者、教授といった外部の専門家に送ってレビューを依頼しました[1]。専門家は各問題の現実味や、目標とする答えが特定可能かどうか、手法や推定量が妥当かを評価し、その意見が問題の改良に使われました。レビュアーからは、扱ったデータには技術的な不備や品質管理上の問題が含まれ、既製の手法を当てはめるだけでは解けない、思慮深い分析が必要だったとの声が寄せられています。問題群とその10問は対話型のWebインターフェースとともにHugging Faceで公開され、50問のサブセットは第三者機関のArtificial Analysisにも提供される予定です[1]。

最新モデルでも正答率は約3割

実際の成績を見ると、OpenAIの最上位モデルであるGPT-5.6 Solは、最高の推論レベルで28.7パーセント、Proモードを有効にした場合は31.5パーセントの正答率を記録しました[1]。これは前身のGeneBenchを作り始めた当時、最高性能だったGPT-5が5パーセント未満だったことと比べると急激な伸びです。OpenAIは、システムレベルの科学的推論という測りにくい能力でも進歩が速く、このベンチマークは年内にも飽和する可能性があるとの見方を示しています。

推論にかける計算量の効きも顕著で、GPT-5.6 Solは推論レベルが最も低い設定では正答率が1桁台にとどまる一方、最高レベルではGPT-5.2の約6倍の問題を、約3分の2のトークン量で解いたとしています[1]。モデルファミリー間の比較では、GLM 5.2のような有力なオープンソースモデルとの差がコーディング系ベンチマークから予想されるよりも大きく、オープンソース勢はコーディングに特化している傾向がうかがえると分析しています。一方で、最新モデルでも問題の3分の1未満しか解けていない事実は、改善の余地が大きいことも示しています。

専門家20〜40時間の作業を数ドルで

GeneBench-Proが投げかけるもう一つの論点が、研究コストの構造です。レビュアーの見積もりによると、典型的な1問を人間の専門家が解くには20〜40時間ほどかかるとされます[1]。控えめに時給200ドル(約3万円)で計算しても、1問あたりの人件費は数千ドル(約数十万円規模)に達します。これに対してAIエージェントの推論コストは1問あたり数ドル(約数百円)にすぎません。

※1ドル=162円で換算(2026年6月30日時点)

現時点のAIは独立した解析を最初から最後まで任せるには信頼性が不足していますが、コスト差は非常に大きく、現在の能力でも部分的な自動化だけで意味のある経済的・科学的価値を生み出せる可能性があります[1]。ゲノム解析のコストが大幅に下がり、分子・表現型・健康記録を結びつけたバイオバンク規模のデータが整いつつある今、ボトルネックはデータ生成から、その情報を実行可能な知見へと変える分析の側へ移りつつあります[2]。仮説の絞り込みや創薬ターゲットの追跡といった作業をAIが安定してこなせるようになれば、研究のスピードを押し上げる存在になり得ます。

まとめ

GeneBench-Proは、知識量や定型処理ではなく、曖昧さの中で妥当な分析の道筋を選ぶという科学研究の核心的な判断力をAIがどこまで備えているかを測る試みです。最新のGPT-5.6 Solでも正答率は3割前後にとどまる一方、進歩の速さや圧倒的なコスト差は、AIが研究現場の補佐役として実用域に近づきつつあることを示しています。モデルの能力が高度化するなかで、こうした抽象度の高い能力を測るベンチマークの重要性は一段と増していきそうです。

出典:https://openai.com/index/introducing-genebench-pro

出典:https://www.biorxiv.org/content/10.64898/2026.06.29.735386v1