OpenAIは2026年6月30日、計算生物学の難問でAIの「判断力」を測る研究者向けベンチマーク「GeneBench-Pro」を公開しました[1]。ゲノミクス・定量生物学・トランスレーショナル医学にまたがる129問で構成され、単なる知識の暗記ではなく、あいまいなデータからどの分析手法を選ぶかという科学者らしい判断を問うのが特徴です。最も強力なモデルGPT-5.6 Solでも正答率は28.7%(Proモード有効時で31.5%)にとどまりました[1]。

「答え」ではなく「判断」を問うベンチマーク

科学のデータには使い方の説明書が付いていません。あるパターンが生物学的な意味を持つのか単なるノイズなのか、そのデータで問いに答えられるのか、次に何をすべきか——研究者はこうした判断を積み重ねます[1]。近年のAIは複雑な分析の実行自体は得意になってきましたが、実際の研究で問われるのは、事前に決められた手順をなぞる力ではなく、こうした高次の判断力です。

GeneBench-Proは、この判断力を正面から測るために設計されました[1]。OpenAIはそれを「リサーチ・テイスト(研究の勘所)」と呼び、どの問いにデータが答えられるか、初期の診断結果を受けて分析方針をどう修正するか、といった一連の判断の連鎖と定義しています。各問題では、現実さながらの雑然としたデータセットと簡単な実験背景、そして意思決定につながる目標値が与えられ、モデルはデータを自ら探索し、適切な手法を選び、試行錯誤しながら最終的な答えを出す必要があります。

129問・10分野をカバーする問題設計

GeneBench-Proは10分野・21のサブ分野にわたる129問を収録します[1]。内訳は集団遺伝学が21問、臨床・薬理ゲノミクス・診断が26問、統計遺伝学と定量遺伝学、制御オミクスが各17問などで、がんゲノミクスや法医学的遺伝学まで含む幅広い構成です。

各問題は合成データで作られている点が大きな特徴です[1]。OpenAIはデータ生成の因果構造をすべて把握したうえでデータを人工的に生成しており、これにより難易度を調整でき、採点を決まった正解に対して機械的に行えます。妥当に見えても誤った分析はきちんと不正解になるよう検証し、抜け道や作問者の好みに合わせるだけで正解できないかも点検しています。さらに、129問のうち82問を大学院生やポスドク、企業の科学者、教授といった外部の専門家に送り、問題の現実性や解答の妥当性を確認してもらいました。公開時には代表的な10問をHugging Faceでオープンソース化し、50問の一部はサードパーティの評価機関Artificial Analysisに提供して独立した検証に回す予定です[1][2]。

最高でも正答率3割弱、それでも急速に進歩

評価では、OpenAIの最上位モデルGPT-5.6 Solが最高の推論レベルで28.7%、Proモード有効時で31.5%の正答率を記録しました[1]。前身の「GeneBench」を作り始めた当時、最上位モデルだったGPT-5が5%未満だったことを踏まえると、大きな伸びです。OpenAIは、このペースなら年内にベンチマークが飽和する可能性もあるとしています。

推論に使う計算量を増やすほど成績が上がる傾向も見られました[1]。最も低い推論レベルではGPT-5.6 Solの正答率は1桁台にとどまりますが、最も高いレベルではGPT-5.2の約6倍の問題を、およそ3分の2のトークン量で解いています。またOpenAIによれば、GLM 5.2のような主要なオープンソースモデルとの差は、コーディング系ベンチマークから予想されるよりも大きく、オープンソース勢はコーディングに特化している一方で、幅広い推論では見劣りするといいます。競合モデルはGPT系の同時期モデルに並ぶのがやっとで、多くは大きく届かなかったとしています。

専門家なら20〜40時間、AIは数ドル

問題の重さも数字で示されています[1]。レビューを担当した専門家の見積もりでは、GeneBench-Proの典型的な1問を人間の専門家が解くには20〜40時間かかるとされます。控えめに1時間200ドル(約3万3000円)で換算しても、1問あたりの人件費は数千ドル(数十万円規模)に達します。一方、AIによる推論コストは1問あたり数ドル(数百円)にすぎません。現状のAIエージェントはまだ信頼性の面で人間の専門家を置き換えるには至りませんが、この大きなコスト差は、部分的な自動化だけでも意義ある経済的・科学的価値を生み得ることを示しています。

※1ドル163円換算(2026年6月30日時点)

背景には、生物学のボトルネックの変化があります[1]。ゲノム解読などデータ生成のコストは劇的に下がり、いまや制約は試料集めではなく、膨大なデータを実用的な知見に変える下流の計算と分析に移りつつあります。遺伝的な裏付けのある創薬標的は承認薬につながりやすいとされ、人間の専門家チームが担ってきた分析をAIが安定してこなせるようになれば、仮説の絞り込みから標的の追跡までを速め、研究のサイクルを大きく変える可能性があります。

まとめ

GeneBench-Proは、AIが計算生物学で「正しい分析の道筋を選べるか」という科学的判断力を測る新しいベンチマークです[1]。最上位のGPT-5.6 Solでも正答率は3割弱にとどまり、モデルが部分的な前進はできても推論を最後まで閉じきれない弱点が浮き彫りになりました。同時に、GPT-5の5%未満から短期間で大きく伸びた事実は、AIの科学的推論が着実に進化していることも示しています。人間の専門家の判断を置き換えるのではなく、その作業を速める道具として、AIが科学研究に食い込み始めた動きとして注目されます。

出典:https://openai.com/index/introducing-genebench-pro/

出典:https://openai.com/index/genebench-pro/case-studies/