OpenAI 於 2026 年 6 月 18 日宣布,已提升 ChatGPT 在健康領域的回答品質[1]。向所有免費使用者開放的全新「GPT‑5.5 Instant」,在判斷是否需要緊急就醫、說明不確定性等方面都有改進,並表示其在最具挑戰性的健康評估中,已達到與公司高階「Thinking」模型相當的水準[1]。
每週 2.3 億人諮詢健康問題,改進惠及免費使用者
OpenAI 指出,健康與身心方面的提問是 ChatGPT 的主要用途之一,每週有超過 2.3 億人透過 ChatGPT 來理解檢驗結果、為就診做準備、辦理保險手續,以及改善生活習慣[1]。
在 GPT‑5.5 Instant 上,辨識是否需要緊急照護、確認必要的背景資訊、說明不確定性,以及把複雜資訊講得更清楚的能力都有所提升[1]。值得注意的是,這些改進並不侷限於部分付費方案,而是向 ChatGPT 的所有免費使用者開放[1]。其目標是從日常身體諮詢到更複雜的臨床情境,全面提升回答的整體水準。
由 60 個國家、逾 260 名醫師支撐的評估體系
回答品質提升的背後,是以醫師為主導的評估機制。OpenAI 表示,公司與遍布 60 個國家、涵蓋 49 種語言和 26 個臨床科別、逾 260 名醫師組成的網路協作,界定在真實健康情境中怎樣才算「好的回答」[1]。
評估使用了該公司公開的「HealthBench」以及更專業的「HealthBench Professional」[1]。HealthBench 是 OpenAI 公開的一套評估基準,透過貼近現實的健康對話與醫師撰寫的評分標準(rubric),衡量準確性、安全性、易懂程度、對情境的掌握,以及回答的完整性等[2]。迄今為止,醫師已審閱超過 70 萬則模型回答範例,且每隔幾分鐘就會有新的回答被審閱[1]。
與醫師回答對比,出錯跡象減少
OpenAI 也進行了一項驗證:讓醫師在不限時間與資料來源(但不使用 AI)的條件下撰寫回答,再由另一組醫師將其與模型回答進行對比[1]。在針對 3,500 則回答的對比中,GPT‑5.5 Instant 在「無法貼合當地醫療狀況」「漏掉危險徵兆或就醫建議」「未追問必要資訊」等失誤上,都比舊模型乃至醫師本人的回答更少[1]。
實際使用趨勢也呈現改善。OpenAI 透過重視隱私保護的監測機制追蹤真實流量,在對比每週數十億則規模的訊息後發現,存在事實性疑慮的回答占比在最近兩個月內下降了 71%[1]。
延伸至醫療第一線的工具
OpenAI 表示,這次的舉措也與專為醫療從業人員設計的「ChatGPT for Clinicians」和「OpenAI for Healthcare」等工具相銜接,這些工具可用於文件撰寫、研究與診療支援[1]。該公司將「改善人類健康」定位為「AGI 帶來最個人化、最具體的影響之一」,並表示會把改進帶給更多人[1]。
不過,這裡列出的數據都是基於 OpenAI 自身的評估與統計。ChatGPT 終究只是整理資訊與輔助諮詢的工具,並不能取代診斷或治療方面的判斷。一旦出現令人擔憂的症狀,及時就醫才是關鍵。
總結
OpenAI 宣布,向免費使用者開放的 GPT‑5.5 Instant 將健康相關回答提升至與頂級模型相當的水準。藉由 60 個國家、逾 260 名醫師參與的評估體系,以及疑似出錯回答在兩個月內下降 71% 的數據,ChatGPT 的健康諮詢正朝著更安全、更實用的方向發展。但與此同時,公開的數據主要來自該公司自身的驗證,將最終的健康判斷交給專業人士仍然不可或缺。
來源:https://openai.com/index/improving-health-intelligence-in-chatgpt/
