OpenAIは2026年6月18日、ChatGPTの健康分野での回答品質を高めたと発表しました[1]。新たにすべての無料ユーザーへ提供される「GPT-5.5 Instant」は、緊急受診が必要な場面の見極めや不確実性の説明などで改善が見られ、最も難しい健康関連の評価では同社の上位モデル「Thinking」に匹敵する水準に達したとしています[1]。
毎週2億3,000万人が健康相談、改善が無料ユーザーにも
OpenAIによると、健康や心身の悩みに関する質問はChatGPTの主要な用途の1つで、毎週2億3,000万人以上が検査結果の読み解きや受診前の準備、保険手続きの確認、生活習慣の改善といった目的でChatGPTを利用しています[1]。
今回のGPT-5.5 Instantでは、緊急のケアが必要かどうかの認識、必要な背景情報の確認、不確実性の説明、複雑な情報をわかりやすく伝える力が向上したとされます[1]。注目したいのは、この改善が一部の有料プランにとどまらず、ChatGPTのすべての無料ユーザーへ提供される点です[1]。日常的な体調の相談から、より複雑な臨床的な状況まで、幅広い場面で回答の底上げを狙ったものといえます。
60か国・260人超の医師が支える評価体制
品質向上の背景には、医師主導の評価の仕組みがあります。OpenAIは60か国・49言語・26の診療科にわたる260人を超える医師のネットワークと協働し、実際の健康相談で「良い回答」とは何かを定義しているとしています[1]。
評価には、同社が公開する「HealthBench」と、より専門的な「HealthBench Professional」が使われます[1]。HealthBenchは、現実に近い健康相談の会話と医師が作成した採点基準(ルーブリック)を用いて、正確さや安全性、伝わりやすさ、状況の把握、回答の網羅性などを測るためにOpenAIが公開した評価基準です[2]。医師はこれまでに70万件を超えるモデルの回答例をレビューしており、数分ごとに新たな回答が確認されているといいます[1]。
医師の回答と比較、誤りの兆候も減少
OpenAIは、医師が時間や情報源の制約なし(ただしAIは使わない条件)で書いた回答と、モデルの回答を別の医師団が比較する検証も行いました[1]。3,500件の回答を対象にした比較では、GPT-5.5 Instantは地域の医療事情に合わせられない、危険な兆候や受診の勧めを見落とす、必要な情報を聞き返さないといった失敗が、旧モデルだけでなく医師自身の回答よりも少なかったと報告しています[1]。
実際の利用傾向でも改善がうかがえます。OpenAIはプライバシーに配慮した監視の仕組みで実トラフィックを追跡しており、週あたり数十億件規模のメッセージを比較したところ、事実関係に問題の疑いがある回答の割合が直近2か月で71パーセント低下したとしています[1]。
医療現場向けツールへの広がり
今回の取り組みは、医療従事者向けに設計された「ChatGPT for Clinicians」や「OpenAI for Healthcare」といった、文書作成や調査、診療支援のためのツールにもつながっているとOpenAIは説明します[1]。同社は「人々の健康の改善は、AGIがもたらす最も個人的で具体的な影響の1つになる」と位置づけ、改善をより多くの人へ届けていく方針を示しました[1]。
ただし、ここで示された数値はいずれもOpenAI自身による評価・集計に基づくものです。ChatGPTはあくまで情報整理や相談の補助であり、診断や治療の判断を代替するものではありません。気になる症状があるときは、医療機関を受診することが大切です。
まとめ
OpenAIは、無料ユーザーにも提供するGPT-5.5 Instantで、健康関連の回答が上位モデル並みに改善したと発表しました。60か国・260人を超える医師が関わる評価体制や、誤りの疑いがある回答が2か月で71パーセント減ったとするデータが示され、ChatGPTの健康相談はより安全で実用的な方向へ進んでいます。一方で公表された数値は同社による検証が中心であり、最終的な健康判断は専門家に委ねる姿勢が引き続き欠かせません。
出典:https://openai.com/index/improving-health-intelligence-in-chatgpt/
