OpenAI 推出了名為 LifeSciBench 的全新基準,用來衡量 AI 在真實生命科學研究中能派上多少用場[1]。它由具備實際藥物研發經驗、擁有博士學位的科學家編寫,共 750 項任務,考的不是單純的知識問答,而是判讀證據、設計實驗這類研究本身的難處。該公司主打生命科學的模型 GPT-Rosalind 繳出了優於上一代的成績,但結果也同時清楚突顯出 AI 至今仍然不足的地方。
LifeSciBench 想衡量的是什麼
過去針對生命科學的評測,大多偏向特定知識的問答,或是答案能乾淨給出的預測題[1]。然而真實的研究是層層堆疊的過程:判讀不完整的證據、調和彼此矛盾的結果、設計高難度的實驗,並在不確定中決定下一步該怎麼做。LifeSciBench 正是聚焦於 AI 能否應付這種現實裡的複雜度。
這項基準包含 750 項任務,橫跨 7 個研究工作流程與 7 個生物學領域[1]。工作流程分為證據處理、分析、設計與最佳化、科學推理、驗證與營運、轉譯(從實驗檯到臨床),以及科學溝通。每項任務都像是向一位內行的合作者提出的請求,先給出科學提問與相關素材,再要求作出自由作答。
任務的設計反映了真實研究的複雜程度[1]。整體而言,79% 的任務需要多步推理或判斷,平均每項 4 步。基準附上 1,062 件素材,包括圖表、PDF、序列檔與化學結構檔等,53% 的任務必須判讀其中至少一件才能作答。
由 173 位科學家編寫 453 位評審驗證
LifeSciBench 的特色,在於專家深度參與了它的編寫[1]。負責撰寫任務的是 173 位受過博士層級訓練、並具備生物科技或製藥產業經驗的科學家。獲採用的任務平均經過 6 輪自動審查與至少 2 輪專家審查,只有在相關領域評審之間取得 90% 以上一致看法的任務才會保留。
評分採用為每項任務量身打造的詳細評分量表(rubric)[1]。它把預期的回答拆解成具體的科學主張、計算、判斷與依據,總數達 19,020 項,平均每項任務 25 項。這套設計不只看最終答案是否正確,還看模型是否透過科學上站得住腳、又對實務有用的路徑得出該答案。
基準的有效性,透過 453 位未參與編寫的評審所做的獨立審查獲得確認[1]。其中 97% 擁有博士或同等學位,平均有 12 年經驗與 14 篇同儕審查論文。他們從任務是否貼近真實研究、是否恰當考查科學推理等角度進行評估,所有項目的一致度都超過 96%。
最新模型 GPT-Rosalind 的成績
OpenAI 把主打生命科學的模型 GPT-Rosalind[2]與上一代 GPT-5.5 做了比較[1]。評測使用兩項指標:達到單項成功門檻(70%)的任務比例稱為合格率,對各評分項給予部分分數的平均值稱為得分。在整體的精確合格率上,GPT-5.5 為 25.7%,而 GPT-Rosalind 提升到 36.1%。
進步最大的是科學溝通與轉譯這兩個方向[1]。科學溝通的合格率從 56.3% 升到 71.1%,不過這個分類只有 9 項任務,需要謹慎看待。把臨床前證據連結到臨床意義的轉譯,也從 36.8% 提升到 57.7%。
從評分項的層級來看,在要求給出對專家真正有用、可付諸行動之輸出的任務上,GPT-Rosalind 拿下 44.7%(GPT-5.5 為 29.1%),在考查不確定性與注意事項處理的任務上拿下 44.8%(GPT-5.5 為 29.3%)[1]。當任務的證據邊界清楚、需要結構化的科學判斷時,AI 往往更能發揮實力。
AI 至今仍不擅長的領域
另一方面,在素材閱讀量大的任務,以及涉及設計的任務上,AI 的弱點相當明顯[1]。設計、最佳化與預測這一工作流程,GPT-Rosalind 的合格率也僅有 30.7%,分析更只有 30.3%。一旦牽涉到圖表或序列檔,成績就會下滑,從純文字任務的 45.1% 掉到附素材任務的 28.1%。
回答的形式同樣會造成差異[1]。在要求給出精確數值的任務上,GPT-Rosalind 僅有 14.8%,在序列或結構輸出上為 24.0%。由於像 CRISPR 設計這類工作需要精確到可直接使用的輸出,這種弱點在研究上意義重大。
OpenAI 本身也謹慎地界定了成果的範圍[1]。LifeSciBench 無法完全重現需要反覆修正假設、隨時間推進的真實研究,高分應被理解為任務層級的能力,而非對下游研究成果的直接衡量。OpenAI 表示,下一步是驗證 AI 在真實研究現場是否真能加速發現。此外要留意的是,這些基準由 OpenAI 自行設計,儘管 LifeSciBench 有外部專家參與評分,其結果尚未經第三方獨立重現[3]。
總結
LifeSciBench 是一項以專家編寫的 750 項任務,衡量 AI 在生命科學研究中能派上多少用場的全新基準[1]。GPT-Rosalind 把整體合格率從 25.7% 提升到 36.1%,在科學溝通與轉譯方面進步尤其明顯[2]。與此同時,它在素材閱讀與精確設計上仍然吃力,絕對合格率也稱不上高。這項指標既映照出 AI 正逐漸成為研究夥伴,也映照出這種夥伴關係的限制。
來源:https://openai.com/index/introducing-life-sci-bench
