波士頓兒童醫院、哈佛大學與 OpenAI 的研究團隊宣布,他們借助 AI 重新分析了 376 件先前未能查明病因的罕見疾病病例,並新增確診 18 件[1]。所使用的工具是 OpenAI 的推理模型「o3 Deep Research」。研究成果於 2026 年 6 月 18 日刊登在醫學期刊 NEJM AI 上。值得注意的是,AI 並未代替醫師做出診斷,而是為專家提供可供查證的線索。
重新分析連專家都無法解決的 376 件
罕見疾病即使接受了基因組定序,仍約有一半的患者無法獲得明確的基因診斷[1]。線索或許就藏在檢查資料之中,但要從成千上萬乃至數百萬個基因變異、零散的診療紀錄,以及日新月異的文獻裡找出來並不容易。隨著新的基因與疾病關聯不斷被提出,過去無法破解的病例日後也可能變得能夠解釋。
研究團隊將 o3 Deep Research 應用於 376 件已分析過卻仍未解決病例的去識別化臨床與基因組資訊[1]。在專家檢視模型提出的候選結果,並完成追加檢測與臨床確認後,共有 18 件確立了診斷。這相當於在專家分析之後又新增了 4.8 個百分點的診斷率,對於一組已被反覆檢視的病例而言,雖小卻具意義。
設計目標是提出可查證的假設,而非診斷
這套流程的關鍵在於,模型扮演架設在既有基因組分析之上的「以解釋為先的推理層」[1]。它並非只是回傳候選基因的排名,而是被設計成把臨床特徵、遺傳方式、變異證據與科學文獻串連起來,提出讓人類審查者得以追問、附帶依據的假設。
模型的輸出本身不會被當作診斷[1]。至少由兩人依據臨床檢驗室所採用的 ACMG/AMP 框架進行評估,意見分歧時以共識裁定。唯有當變異被歸類為「致病」或「很可能致病」,並在通過 CLIA 認證的實驗室得到確認、由臨床團隊把結果回報給家屬之後,才會被認定為診斷。
在準確性驗證中,對於已確診的 51 件,這套流程在 48 件中重現了正確的基因與變異;神經肌肉疾病 57 件中命中 45 件;在 15 件長讀長基因組中更是全部說對了正確的基因[1]。模型自報的信心程度也區分明顯:正確時平均為 85.6,錯誤或未知時為 42.1,有助於審查者排定優先順序。
歷經近 20 年才確診的女性
成果之一來自神經肌肉疾病世代中 Kyra 的病例[1]。她 9 歲時因空手道動作再也無法壓低而被發現肌力下降,此後近 20 年始終無法確診。13 歲時她已離不開呼吸器與輪椅,而這次重新分析鎖定了 HSPB8 基因的移碼變異,確診為一種「肌原纖維肌病」,肌纖維中會堆積異常的蛋白質團塊。在她 28 歲生日前約一週,遺傳諮詢師打來了電話。
模型有時還能推斷出輸入資料中沒有的結構性變化[1]。在一件早發精神病病例中,它把 22 號染色體上一連串低品質的分析結果,與患者在心臟、免疫、神經發育及精神方面的特徵連結起來,提出與 DiGeorge 症候群相關的「22q11.2 缺失」假設,並經追加基因組定序獲得證實。它也針對導致皮膚色素脫失的 vitiligo(白斑)提示了可能涉及 S1PR1 基因缺失的新機制。
期待,以及不容忽視的侷限
研究團隊謹慎地界定了成果的範圍[1]。這是一項回顧過往病例的回溯性研究,各世代性質參差不齊,審查者在評估時也知道模型的信心分數。研究並未測量診斷所需的時間、成本、誤判負擔以及對醫療的影響。由於大型語言模型可能誤讀脈絡、給出看似合理卻禁不起細究的解釋,因此所有結果都經過人工判斷與臨床確認。其定位是:AI 拓寬了搜尋範圍,專家負責收斂結論。
下一階段,Manton Center 將獲得 OpenAI Foundation 的資助,主導開發不依賴特定平台的低成本「遺傳學 AI 副駕駛」[1]。這一系列工作也被海外媒體廣泛報導,被視為將 AI 用於醫學研究的具體範例[2]。Manton Center 主任 Alan Beggs 表示:「像凱瑟琳和我這樣的研究者,根本不可能把 8,000 種不同的疾病全裝進腦袋裡。這正是 AI 的力量所在。」[1]
總結
借助 OpenAI 的推理模型「o3 Deep Research」,對 376 件連專家都未能解決的罕見疾病病例重新分析後,新增確立了 18 件診斷[1]。模型並不親自下診斷,而是提供附帶依據、可供查證的假設,最終判斷仍由醫師做出。在兼顧準確性與侷限的同時,這也是讓「定期重新分析」,即隨著知識更新而重新檢視舊病例,變得切實可行的一步。
來源:https://openai.com/index/diagnose-rare-childhood-diseases
來源:https://www.nbcnews.com/tech/innovation/ai-boston-childrens-hospital-diagnose-rare-diseases-kids-openai-rcna350387
