OpenAI 发布了一项名为 LifeSciBench 的新基准,用于衡量 AI 在真实生命科学研究中的实际作用[1]。它由具有实际药物研发经验、拥有博士学位的科学家编写,共 750 项任务,考查的不是简单的知识问答,而是解读证据、设计实验等研究本身的难点。该公司面向生命科学的模型 GPT-Rosalind 取得了优于上一代的成绩,但结果同时清楚地暴露出 AI 仍然薄弱的领域。
LifeSciBench 想要衡量什么
以往面向生命科学的评测大多偏向特定知识的问答,或答案能够干净给出的预测题[1]。然而真实研究是层层叠加的过程:解读不完整的证据、调和相互矛盾的结果、设计高难度实验,并在不确定中决定下一步该做什么。LifeSciBench 正是聚焦于 AI 能否应对这种现实中的复杂性。
该基准包含 750 项任务,横跨 7 个研究工作流程和 7 个生物学领域[1]。工作流程分为证据处理、分析、设计与优化、科学推理、验证与运营、转化(从实验台到临床),以及科学沟通。每项任务都像是向一位内行的合作者提出的请求,给出科学提问和相关材料后,要求作出自由作答。
任务的设计反映了真实研究的复杂程度[1]。整体上 79% 的任务需要多步推理或判断,平均每项 4 步。基准附带 1,062 件资料,包括图表、PDF、序列文件和化学结构文件等,53% 的任务需要解读其中至少一件才能作答。
由 173 位科学家编写 453 位评审验证
LifeSciBench 的特点在于专家深度参与了它的编写[1]。编写任务的是 173 位接受过博士层次训练、并拥有生物技术或制药行业经验的科学家。被采纳的任务平均经过 6 轮自动审查和至少 2 轮专家审查,只有在相关领域评审之间获得 90% 以上一致意见的任务才被保留。
评分使用为每项任务专门准备的详细评分量表(rubric)[1]。它把期望的回答拆解为具体的科学主张、计算、判断和依据,总数达 19,020 项,平均每项任务 25 项。这一设计不仅考查最终答案是否正确,还考查模型是否通过科学上站得住脚、且对实务有用的路径得出该答案。
基准的有效性通过 453 位未参与编写的评审进行的独立审查得到确认[1]。其中 97% 拥有博士或同等学位,平均有 12 年经验和 14 篇同行评审论文。他们从任务是否贴合真实研究、是否恰当地考查科学推理等角度进行评估,所有项目的一致度都超过 96%。
最新模型 GPT-Rosalind 的成绩
OpenAI 将面向生命科学的模型 GPT-Rosalind[2]与上一代 GPT-5.5 作了比较[1]。评测使用两项指标:达到单项成功阈值(70%)的任务比例称为合格率,对各评分项给予部分分的平均值称为得分。在整体的精确合格率上,GPT-5.5 为 25.7%,而 GPT-Rosalind 提升到了 36.1%。
提升最大的是科学沟通和转化两个方向[1]。科学沟通的合格率从 56.3% 升至 71.1%,不过该分类只有 9 项任务,需要谨慎看待。把临床前证据连接到临床意义的转化,也从 36.8% 提升到 57.7%。
从评分项的层面看,在要求给出对专家真正有用、可操作输出的任务上,GPT-Rosalind 取得 44.7%(GPT-5.5 为 29.1%),在考查不确定性与注意事项处理的任务上取得 44.8%(GPT-5.5 为 29.3%)[1]。当任务的证据边界清晰、需要结构化的科学判断时,AI 往往更能发挥实力。
AI 仍然不擅长的领域
另一方面,在资料阅读量大的任务和涉及设计的任务上,AI 的薄弱十分明显[1]。设计、优化与预测这一工作流程,GPT-Rosalind 的合格率也仅为 30.7%,分析则只有 30.3%。一旦涉及图表或序列文件,成绩便会下滑,从纯文本任务的 45.1% 降到带资料任务的 28.1%。
回答的形式也会带来差异[1]。在要求给出精确数值的任务上,GPT-Rosalind 仅为 14.8%,在序列或结构输出上为 24.0%。由于像 CRISPR 设计这类工作需要精确到可直接使用的输出,这种薄弱在研究上意义重大。
OpenAI 自己也谨慎地界定了成果的范围[1]。LifeSciBench 无法完全再现需要反复修正假设、随时间推进的真实研究,高分应被理解为任务层面的能力,而非对下游研究成果的直接衡量。OpenAI 表示,下一步是验证 AI 在真实研究现场是否真能加速发现。此外需要留意的是,这些基准由 OpenAI 自行设计,尽管 LifeSciBench 有外部专家参与评分,其结果尚未经第三方独立复现[3]。
总结
LifeSciBench 是一项用专家编写的 750 项任务来衡量 AI 在生命科学研究中实际作用的新基准[1]。GPT-Rosalind 将整体合格率从 25.7% 提升到 36.1%,在科学沟通和转化方面进步尤为明显[2]。与此同时,它在资料阅读和精确设计上仍然吃力,绝对合格率也算不上高。这项指标既映照出 AI 正在成为研究伙伴,也映照出这种伙伴关系的局限。
来源:https://openai.com/index/introducing-life-sci-bench
