OpenAI 於 2026 年 6 月 30 日發布了 GeneBench-Pro,這是一套面向研究人員的基準,用來衡量 AI 在計算生物學難題上的「判斷力」[1]。它涵蓋基因體學、定量生物學與轉譯醫學的 129 道題目,考驗的並非單純的知識記憶,而是科學家面對含糊資料時要選擇哪種分析方法的判斷。即使是最強的模型 GPT-5.6 Sol,正確率也僅有 28.7%(開啟 Pro 模式時為 31.5%)[1]。

考驗「判斷」而非「答案」的基準

科學資料往往不會附上使用說明。研究者必須反覆判斷:某個規律反映的是生物學現象還是雜訊、這些資料能否支撐所提出的問題,以及下一步該做什麼[1]。近年來 AI 在執行複雜分析本身上已相當出色,但真實研究考驗的並不是照搬既定流程的能力,而是這種更高層次的判斷力。

GeneBench-Pro 正是為了正面衡量這種能力而設計的[1]。OpenAI 將其稱為「研究品味」,並定義為形塑一項分析的一連串判斷:資料能回答哪些問題,以及早期診斷結果應如何改變建模方向。每道題都會給模型一個貼近現實的雜亂資料集、簡短的實驗背景,以及一個與後續決策相關的目標值,模型必須自行探索資料、選擇合適的方法,在反覆試驗中給出最終答案。

涵蓋 10 個領域、129 道題的題目設計

GeneBench-Pro 收錄了橫跨 10 個領域、21 個子領域的 129 道題[1]。其中族群遺傳學 21 道,臨床、藥物基因體學與診斷 26 道,統計遺傳學、定量遺傳學與調控體學各 17 道,還延伸到癌症基因體學與法醫遺傳學,構成相當廣泛。

一大特點是每道題都由合成資料建構[1]。OpenAI 完全掌握資料生成的因果結構並以人工方式模擬生成資料,因此得以調節難度,並針對已知正確答案進行機械化評分。看似合理卻錯誤的分析會被驗證為不通過,題目也經過稽核,確保無法靠走捷徑或迎合出題者偏好來答對。此外,129 道題中有 82 道被送交外部領域專家——研究生、博士後、業界科學家與教授——以核實每道題的真實性與答案的合理性。發布時,10 道代表性題目在 Hugging Face 上開源,其中 50 道題的一部分還將提供給第三方評測機構 Artificial Analysis 進行獨立評測[1][2]。

最高也僅解出不到三成,但進步迅速

在評測中,OpenAI 的頂級模型 GPT-5.6 Sol 在最高推理水準下取得 28.7% 的正確率,開啟 Pro 模式時為 31.5%[1]。考量到最初建構前代「GeneBench」時,當時的頂級模型 GPT-5 得分不足 5%,這是相當大的提升。OpenAI 表示,照此速度,該基準有可能在年內被刷滿。

投入越多的推理算力,成績也越高[1]。在最低推理水準下 GPT-5.6 Sol 的正確率僅為個位數,而在最高水準下,它解出的題目數量接近 GPT-5.2 的六倍,所用 token 卻約為其三分之二。OpenAI 也指出,與 GLM 5.2 等主流開源模型的差距,比從程式設計類基準推斷出的更大,這顯示開源模型更擅長程式設計,在廣泛推理上則略遜一籌。競品模型至多與同期對應的 GPT 模型打平,多數則相差甚遠。

專家需 20 至 40 小時,AI 只需幾美元

題目的分量也有量化[1]。據負責審查的專家估計,人類專家解出一道典型的 GeneBench-Pro 題目約需 20 至 40 小時。即使以較保守的每小時 200 美元(約 3.3 萬日圓)換算,單題的人力成本也高達數千美元(數十萬日圓規模)。相較之下,AI 的推理成本每題僅為幾美元(數百日圓)。目前的 AI 代理在可靠性上仍不足以取代人類專家,但如此龐大的成本差距顯示,即便只是部分自動化,也能創造有意義的經濟與科學價值。

※1 美元 = 163 日圓(截至 2026 年 6 月 30 日)

這背後是生物學瓶頸的轉移[1]。基因體定序等資料生成的成本已大幅下降,制約因素正從樣本採集轉向把海量資料轉化為可用洞見的下游運算與分析。由於有遺傳學證據支撐的藥物標靶更容易走向獲准藥物,若模型能穩定完成以往由人類專家團隊承擔的分析,就有望加快假設篩選與標靶追蹤,進而重塑研究循環。

總結

GeneBench-Pro 是一套衡量 AI 能否在計算生物學中「選對分析路徑」的新基準,考驗的是科學判斷力[1]。即使是頂級的 GPT-5.6 Sol,也只能解出不到三成題目,暴露出模型能取得部分進展、卻難以閉合推理迴路的弱點。同時,從 GPT-5 不足 5% 的大幅躍升也說明,AI 的科學推理正在穩步進化。它作為 AI 進入科學研究的一個範例而受到關注——並非取代專家判斷,而是加速研究工作。

出典:https://openai.com/index/introducing-genebench-pro/

出典:https://openai.com/index/genebench-pro/case-studies/