OpenAI 推出了新基準「GeneBench-Pro」,用來衡量 AI 代理在計算生物學研究中能在多大程度上做出恰當的判斷[1]。此基準由涵蓋基因體學、定量生物學與轉譯醫學的 129 道題目組成,考察的並非對事實的記憶或依既定流程執行,而是研究者特有的判斷力,例如從模糊不清的資料中選擇何種分析路徑。即便是最新模型,正確率也僅在 3 成左右,因此它作為衡量 AI 能否在真實科研中輔助人類專家的指標而備受關注。
考察的不是知識,而是「通往正解的路徑」
GeneBench-Pro 想要衡量的並非回答事實的能力。科學資料並不會附帶說明書,研究者必須判斷某個模式究竟反映了真實的生物學訊號還是單純的雜訊,判斷資料能否支撐所提出的問題,並據此決定下一步該怎麼做[1]。OpenAI 將這一連串判斷稱為「研究品味」,並把它的優劣作為評估對象。
在每道題目中,模型會得到一個真實而雜亂的資料集、簡要的實驗背景,以及與下游決策掛鉤的目標量。模型必須探索資料、選擇合適的分析方法、反覆試驗,最終給出答案。在實際解題環境方面,每道題都提供一個隔離的工作區,其中配備了包括 Python 與 PLINK 2.0 在內的標準生物資訊學工具集[1]。
129 道題目皆為人工合成,並經專家審查
在既有的基準中,若使用過去的雜亂資料,「通往正解的路徑」往往無法唯一確定,評估結果會反映出題者的隨意選擇。為避免此問題,GeneBench-Pro 將每道題目連同資料生成的因果結構一起進行人工模擬生成[1]。如此一來便可調節題目難度,並設計為即使在分析上存在合理的解釋差異,數值也能落在可接受範圍內,同時確認那些看似合理但實則錯誤的分析會被正確判為錯誤。
此外,OpenAI 還將 129 道題目中的 82 道寄送給研究生、博士後、企業研究人員與教授等外部領域專家進行審查[1]。專家評估每道題目的真實性、目標答案是否可辨識,以及方法與估計量是否恰當,其意見被用於改進題目。審查者表示,所涉資料包含技術缺陷與品質管制問題,僅靠套用現成方法無法解決,需要審慎的分析。題目集及其中 10 道代表性題目連同互動式網頁介面在 Hugging Face 上公開,50 道題的子集還將提供給第三方機構 Artificial Analysis[1]。
即便最新模型正確率也約為 3 成
從實際成績來看,OpenAI 效能最強的模型 GPT-5.6 Sol 在最高推理等級下取得了 28.7% 的正確率,啟用 Pro 模式時為 31.5%[1]。與開始建構前身 GeneBench 時、當時效能最強的 GPT-5 不足 5% 相比,這是一次急劇的提升。OpenAI 認為,即便在難以衡量的系統級科學推理上進步也很快,這項基準有可能在年內就趨於飽和。
推理運算量的作用同樣明顯:GPT-5.6 Sol 在推理等級最低的設定下正確率僅為個位數,而在最高等級下,以約三分之二的 token 量解出了約為 GPT-5.2 六倍數量的題目[1]。在模型家族之間的比較中,與 GLM 5.2 等強力開源模型的差距超出了從程式設計類基準的預期,顯示出開源陣營更偏向於專攻程式設計。另一方面,即便是最新模型也只能解出不到三分之一的題目,這也表明仍有很大的改進空間。
把專家 20 至 40 小時的工作變成幾美元
GeneBench-Pro 還拋出了另一個關於科研成本結構的議題。據審查者估算,人類專家解出一道典型題目大約需要 20 至 40 小時[1]。即便以保守的每小時 200 美元(約 3 萬日圓)計算,單題的人力成本也高達數千美元(約數十萬日圓規模)。相較之下,AI 代理的推理成本每題僅為幾美元(約數百日圓)。
※以 1 美元 = 162 日圓換算(截至 2026 年 6 月 30 日)
現階段的 AI 在可靠度上還不足以讓它從頭到尾獨立完成分析,但成本差距非常巨大,即便以目前能力進行部分自動化,也有望創造有意義的經濟與科學價值[1]。隨著基因定序成本大幅下降、將分子、表現型與健康紀錄連結起來的生物樣本庫規模資料日趨完善,瓶頸正從資料生成轉向把這些資訊轉化為可執行洞見的分析環節[2]。若 AI 能夠穩定勝任假設篩選與藥物標靶追蹤等工作,便有望成為推動科研提速的力量。
總結
GeneBench-Pro 試圖衡量的,是 AI 在多大程度上具備在模糊之中選擇恰當分析路徑這一科研核心判斷力,而非知識量或例行處理能力。儘管最新的 GPT-5.6 Sol 正確率仍在 3 成左右,但進步之快與壓倒性的成本差距顯示,AI 正逐步接近作為科研輔助者的實用水準。隨著模型能力日益高階,衡量這類高抽象度能力的基準,其重要性預計將進一步提升。
出典:https://openai.com/index/introducing-genebench-pro
出典:https://www.biorxiv.org/content/10.64898/2026.06.29.735386v1
