OpenAI 于 2026 年 6 月 30 日发布了 GeneBench-Pro,这是一个面向研究人员的基准,用于衡量 AI 在计算生物学难题上的「判断力」[1]。它涵盖基因组学、定量生物学与转化医学的 129 道题目,考查的不是单纯的知识记忆,而是科学家面对含糊数据时选择何种分析方法的判断。即便是最强的模型 GPT-5.6 Sol,正确率也只有 28.7%(开启 Pro 模式时为 31.5%)[1]。

考查「判断」而非「答案」的基准

科学数据往往不附带使用说明。研究者必须反复判断:某个规律反映的是生物学现象还是噪声,这些数据能否支撑所提出的问题,以及下一步该做什么[1]。近年来 AI 在执行复杂分析本身上已相当出色,但真实研究考验的并非照搬既定流程的能力,而是这种更高层次的判断力。

GeneBench-Pro 正是为了正面衡量这种能力而设计的[1]。OpenAI 将其称为「研究品味」,并定义为塑造一项分析的一连串判断:数据能回答哪些问题,以及早期诊断结果应如何改变建模方向。每道题都会给模型一个贴近现实的杂乱数据集、简短的实验背景,以及一个与后续决策相关的目标值,模型必须自行探索数据、选择合适的方法,在反复试验中给出最终答案。

覆盖 10 个领域、129 道题的题目设计

GeneBench-Pro 收录了横跨 10 个领域、21 个子领域的 129 道题[1]。其中群体遗传学 21 道,临床、药物基因组学与诊断 26 道,统计遗传学、定量遗传学与调控组学各 17 道,还延伸到癌症基因组学和法医遗传学,构成十分广泛。

一大特点是每道题都由合成数据构建[1]。OpenAI 完全掌握数据生成的因果结构并人工模拟生成数据,从而可以调节难度,并针对已知正确答案进行机械化评分。看似合理却错误的分析会被验证为不通过,题目也经过审核,确保无法靠走捷径或迎合出题者偏好来答对。此外,129 道题中有 82 道被送交外部领域专家——研究生、博士后、企业科学家与教授——以核实每道题的真实性和答案的合理性。发布时,10 道代表性题目在 Hugging Face 上开源,其中 50 道题的一部分还将提供给第三方评测机构 Artificial Analysis 进行独立评测[1][2]。

最高也仅解出不到三成,但进步迅速

在评测中,OpenAI 的顶级模型 GPT-5.6 Sol 在最高推理水平下取得 28.7% 的正确率,开启 Pro 模式时为 31.5%[1]。考虑到最初构建前代「GeneBench」时,当时的顶级模型 GPT-5 得分不足 5%,这是相当大的提升。OpenAI 表示,照此速度,该基准有可能在年内被刷满。

投入越多的推理算力,成绩也越高[1]。在最低推理水平下 GPT-5.6 Sol 的正确率仅为个位数,而在最高水平下,它解出的题目数量接近 GPT-5.2 的六倍,所用 token 却约为其三分之二。OpenAI 还指出,与 GLM 5.2 等主流开源模型的差距,比从编程类基准推断出的更大,这表明开源模型更擅长编程,而在广泛推理上稍逊一筹。竞品模型至多与同期对应的 GPT 模型持平,多数则相差甚远。

专家需 20 至 40 小时,AI 只需几美元

题目的分量也有量化[1]。据负责评审的专家估计,人类专家解出一道典型的 GeneBench-Pro 题目约需 20 至 40 小时。即便按较保守的每小时 200 美元(约 3.3 万日元)折算,单题人力成本也高达数千美元(数十万日元规模)。相比之下,AI 的推理成本每题仅为几美元(数百日元)。当前的 AI 智能体在可靠性上仍不足以取代人类专家,但如此巨大的成本差距表明,即便是部分自动化,也能创造有意义的经济与科学价值。

※1 美元 = 163 日元(截至 2026 年 6 月 30 日)

这背后是生物学瓶颈的转移[1]。基因组测序等数据生成的成本已大幅下降,制约因素正从样本采集转向把海量数据转化为可用见解的下游计算与分析。由于有遗传学证据支撑的药物靶点更容易走向获批药物,如果模型能稳定完成以往由人类专家团队承担的分析,就有望加快假设筛选与靶点跟进,从而重塑研究循环。

总结

GeneBench-Pro 是一个衡量 AI 能否在计算生物学中「选对分析路径」的新基准,考查的是科学判断力[1]。即便是顶级的 GPT-5.6 Sol,也只能解出不到三成题目,暴露出模型能取得部分进展、却难以闭合推理链条的弱点。与此同时,从 GPT-5 不足 5% 的大幅跃升也说明,AI 的科学推理正在稳步进化。它作为 AI 进入科学研究的一个范例受到关注——不是取代专家判断,而是加速研究工作。

出典:https://openai.com/index/introducing-genebench-pro/

出典:https://openai.com/index/genebench-pro/case-studies/