OpenAIは、最新モデルGPT-5.4と、Molecule.oneの自律実験システム「Maria」を組み合わせ、創薬で使われる難しい化学反応を改善したと公式サイトで明らかにしました[1]。AIが自ら仮説を立て、ロボット化された実験室で1万件を超える反応を試した結果、これまで収率の低かった反応の効率を底上げする添加剤を見つけ出しています。人間の化学者が最終的な判断を担う「ほぼ自律」の枠組みながら、AIが研究の一連の流れに踏み込んだ点で注目される成果です。
GPT-5.4と自律実験室「Maria」を組み合わせた研究
今回の研究は、AIを科学者のパートナーにするというOpenAIの一連の取り組みの延長線上にあります[1]。同社はこれまでも、数学や理論物理、生物学などの分野でモデルが新しい結果に貢献した例を示してきました。今回はその対象を、創薬に直結する「医薬化学(メディシナルケミストリー)」へと広げた格好です。
具体的には、創薬支援を手がけるMolecule.oneと協力し、GPT-5.4を同社のAI「Maria」に接続しました[1]。Mariaは、ハイスループット(大量並列)な実験設備と一体化した、自律的に研究を進めるための化学AIです。研究チームはこのシステムに「重要な反応クラスのいずれかを改善する」という、答えの決まっていない大まかな目標だけを与えました。
システムは研究の提案を生成し、実験を設計・実行し、得られたデータを分析して、次に試すべき実験を提案します[1]。一方で人間の化学者も、AIを方向付ける指示や評価基準を設計し、試す提案を選び、実験計画に限定的な修正を加えるといった形で関わり続けました。最終結果の独立した検証も人間が担っています。
鍵となった「Chan–Lam カップリング」の難しさ
AIが最も有望と判断した提案「OAI-M1-03」が狙ったのは、Chan–Lam カップリングと呼ばれる反応の難しいタイプの改善です[1]。Chan–Lam カップリングは炭素と窒素を結びつける結合をつくる反応で、医薬品の分子に広く含まれる構造を組み立てるのに使われます[1][2]。
ただし、この反応はあらゆる分子でうまくいくわけではありません。特に、ボロン酸と「第一級スルホンアミド」と呼ばれる物質を結合させる場合、歴史的に収率が低いことが知られていました[1]。スルホンアミドは抗がん剤や抗菌薬、利尿薬など幅広い医薬品に登場する重要な分子群です。合成は創薬の大きなボトルネックで、研究者はつくれる分子しか試せないため、この反応を安定させられれば試せる候補分子の幅が広がります。
GPT-5.4は、答えの決まっていない目標から出発して、第一級スルホンアミドを「難しいが価値の高い対象」として自ら特定しました[1]。そのうえで、TEMPOを含む温和な酸化剤を加えると反応が改善するのではないか、という提案を示しています。化学者にとっては意外で、興味深い指摘だったといいます。
1万件を超える自動実験で収率が向上
Maria Labでの2巡の実験を通じて、この提案は明確な改善につながりました[1]。最適化した条件のもとで、試したボロン酸の88パーセント、スルホンアミドの83パーセントで収率が向上しています。平均収率は16.6パーセントから25.2パーセントへと上がり、収率30パーセントを超える反応の割合も15.6パーセントから37.5パーセントへ増えました。
実験の規模も大きな意味を持ちました。Mariaは2巡で合計10,080件の反応を実行しています[1]。これは、1日に3件の反応を行う化学者が10年かけても届かない数です。少数の例だけでは化学の結果は誤解を招きやすく、膨大な反応を試したことで、10種類の酸化剤の中からTEMPOの効果を見極め、その効き目と限界を確認できたとしています。
さらに、1巡目のデータ分析を経て提案された2巡目では、TEMPOをより安価な類似物質「4-hydroxy-TEMPO」に置き換えても性能がほとんど落ちないことも分かりました[1]。
結果は微量スケールのスクリーニングだけにとどまりませんでした。人間の化学者が代表的な反応を通常の実験台(ベンチスケール)で手作業により再現したところ、14組の基質ペアのうち11組で収率が上がり、そのうち8組では2倍を超える向上が見られました[1]。ごく小さなスケールの実験は、規模を変えると消えてしまう見かけ上の効果を生むことがあるため、この再現は重要だと位置づけられています。外部の化学の専門家4人がプレプリント(査読前論文)を確認し、結果が新規で共有する価値があるとの評価を支持しました。
「ほぼ自律」が意味すること、そして限界
OpenAIはこの一連の流れを、完全な自律ではなく「ほぼ自律(near-autonomous)」と表現しています[1]。重要な判断はあくまで人間の化学者が担い続けたためです。モデルが鍵となる研究のアイデアを提案する一方で、人間は大局的な方向付けや判断を行い、実験の細部を修正し、試薬や消耗品の準備を助け、要となる実験を手作業で再現しました。実際、最も大きな人間による修正は、強い酸化剤と反応する懸念から、溶媒のジメチルスルホキシド(DMSO)の使用を避けるよう指示したことでした。
3カ月をかけた取り組みは、3月4日の最初の指示から、6月4日に独立した専門家へOAI-M1-03の結果を共有するまで続きました[1]。GPT-5.4とMariaが試した4件の提案のうち、OAI-M1-02とOAI-M1-04は実験で裏づけられ、OAI-M1-01は否定されています。
もっとも、OpenAI自身が成果の範囲を慎重に区切っています[1]。今回の結果は、AIが化学の研究プログラムを端から端まで独力で回せることを示すものではなく、専用のハイスループット設備に支えられていました。ほかのカップリング反応や別の基質、製造条件にそのまま当てはまる保証もなく、反応の仕組みの解明や独立した追試はこれからの課題です。OpenAIは、医薬や材料科学に役立つ技術が悪用されうる点にも触れ、今回の研究を毒物や化学兵器を扱わない正当な医薬化学の課題に限定したと説明しています。使用したモデルは英国のAI Security Institute(AISI)による関連評価を受けており、有害な用途の要求は拒否するよう設計されているとしています。
まとめ
OpenAIはGPT-5.4とMolecule.oneの自律実験システム「Maria」を組み合わせ、創薬で使われるChan–Lam カップリングの難しいタイプを改善しました[1]。AIが第一級スルホンアミドという難しい対象を自ら見極め、TEMPOという添加剤を提案した結果、平均収率が16.6パーセントから25.2パーセントへ向上し、人間による実験台での再現でも効果が確認されています。重要な判断は人間が担う「ほぼ自律」の段階であり、追試や適用範囲の見極めは残されているものの、AIが仮説の提案から実験、解釈までの研究の流れに具体的に貢献した一例と言えるでしょう。
