波士顿儿童医院、哈佛大学与 OpenAI 的研究团队宣布,他们借助 AI 重新分析了 376 例此前未能查明病因的罕见病病例,并新增确诊 18 例[1]。所用工具是 OpenAI 的推理模型「o3 Deep Research」。研究成果于 2026 年 6 月 18 日发表在医学期刊 NEJM AI 上。值得注意的是,AI 并未代替医生做出诊断,而是为专家提供可供核查的线索。
重新分析连专家都无法解决的 376 例
罕见病即便接受了基因组测序,仍有约一半的患者无法获得明确的基因诊断[1]。线索可能就藏在检查数据中,但要从成千上万乃至数百万个基因变异、碎片化的诊疗记录以及日新月异的文献中找出来并不容易。随着新的基因与疾病关联不断被报告,过去无法破解的病例日后也可能变得可以解释。
研究团队将 o3 Deep Research 应用于 376 例已分析过却仍未解决病例的去标识化临床与基因组信息[1]。在专家审阅模型给出的候选结果,并完成追加检测与临床确认后,共有 18 例确立了诊断。这相当于在专家分析之后又新增了 4.8 个百分点的诊断率,对于一组已被反复审视的病例而言,虽小却有意义。
设计目标是给出可核查的假设,而非诊断
这套流程的关键在于,模型充当架设在既有基因组分析之上的「以解释为先的推理层」[1]。它并非只是返回候选基因的排名,而是被设计为将临床特征、遗传方式、变异证据与科学文献串联起来,给出人类审阅者可以追问的、附带依据的假设。
模型的输出本身不会被当作诊断[1]。至少由两人依据临床实验室所用的 ACMG/AMP 框架进行评估,意见分歧时通过共识裁定。只有当变异被归类为「致病」或「很可能致病」,并在通过 CLIA 认证的实验室得到确认、由临床团队将结果反馈给家属之后,才会被认定为诊断。
在准确性验证中,对于已确诊的 51 例,该流程在 48 例中重现了正确的基因与变异;神经肌肉疾病 57 例中命中 45 例;在 15 例长读长基因组中则全部说对了正确的基因[1]。模型自报的置信度也区分明显:正确时平均为 85.6,错误或未知时为 42.1,有助于审阅者排定优先顺序。
历经近 20 年才确诊的女性
成果之一来自神经肌肉疾病队列中 Kyra 的病例[1]。她 9 岁时因空手道动作无法再压低而被发现肌力下降,此后近 20 年一直无法确诊。13 岁时她已离不开呼吸机和轮椅,而这次重新分析锁定了 HSPB8 基因的移码变异,确诊为一种「肌原纤维肌病」,肌纤维中会堆积异常的蛋白质团块。在她 28 岁生日前约一周,遗传咨询师打来了电话。
模型有时还能推断出输入数据中没有的结构性改变[1]。在一例早发精神病病例中,它将 22 号染色体上一连串低质量的分析结果与患者在心脏、免疫、神经发育和精神方面的特征联系起来,提出与 DiGeorge 综合征相关的「22q11.2 缺失」假设,并经追加基因组测序得到证实。它还就导致皮肤色素脱失的 vitiligo(白癜风)提示了可能涉及 S1PR1 基因缺失的新机制。
期待,以及不容忽视的局限
研究团队谨慎地界定了成果的范围[1]。这是一项回顾以往病例的回顾性研究,各队列性质参差不齐,审阅者在评估时也知晓模型的置信度。研究并未测量诊断所需的时间、成本、误报负担以及对医疗的影响。由于大语言模型可能误读语境、给出看似合理却经不起推敲的解释,因此所有结果都经过了人工判断与临床确认。其定位是:AI 拓宽了搜索范围,专家负责收窄结论。
下一阶段,Manton Center 将获得 OpenAI Foundation 的资助,主导开发不依赖特定平台的低成本「遗传学 AI 副驾驶」[1]。这一系列工作也被海外媒体广泛报道,被视为将 AI 用于医学研究的具体范例[2]。Manton Center 主任 Alan Beggs 表示:「像凯瑟琳和我这样的研究者,根本不可能把 8,000 种不同的疾病都装在脑子里。这正是 AI 的力量所在。」[1]
总结
借助 OpenAI 的推理模型「o3 Deep Research」,对 376 例连专家都未能解决的罕见病病例进行重新分析后,新增确立了 18 例诊断[1]。模型并不亲自下诊断,而是提供附带依据、可供核查的假设,最终判断仍由医生做出。在兼顾准确性与局限的同时,这也是让「定期重新分析」,即随着知识更新而重新审视旧病例,变得切实可行的一步。
来源:https://openai.com/index/diagnose-rare-childhood-diseases
来源:https://www.nbcnews.com/tech/innovation/ai-boston-childrens-hospital-diagnose-rare-diseases-kids-openai-rcna350387
