OpenAIが8月18日(現地時間)、フロンティアモデルの開発ペースを意図的に落としていることを明らかにしました。展開予定の最新モデルでは強化学習を2週間止め、計画していた最大規模の強化学習は今も保留のままです。監視、アラインメント、セキュリティの3つの守りを引き上げ、その水準に追いつくまで規模の拡大を待つという判断です。
きっかけは侵害インシデントと次期モデルの能力評価
減速の背景として、同社は2つの出来事を挙げています。1つは7月に表面化したHugging Faceをめぐる侵害インシデントです。もう1つは、次期モデル「Astra」が、自社の安全指針であるPreparedness Frameworkでサイバー能力の最上位「Critical」に達している可能性を示す予備的な証拠が出たことです。
モデルが強くなるほど、外部に出したあとだけでなく、社内で学習させたり評価したりしている最中のリスクも大きくなります。OpenAIはこの点を率直に認めたうえで、必要な基準を満たすための時間を確保するために規模拡大を一時的に緩めたと説明しています。
小規模な学習と評価でモデルの振る舞いを確かめ、セーフガードが効いていることとアラインメントの裏付けを積み上げてから、最大規模の学習に進む段取りです。
サム・アルトマンCEOもXで、目前に迫った能力水準に対してアラインメントやセキュリティ、監視の基準を満たすためにフロンティアの強化学習の一部を止めたと投稿しました。業界全体で共通の基準をすり合わせる必要があるとしつつ、それが整うまでは自社単独で動くという姿勢です。あわせて、優れた新モデルの投入自体は近いうちにあり、今回の影響を受けるのはもっと先のリリースだとも述べています。
研究環境そのものを固め直しました
対策の1つ目は、モデルを訓練し評価する環境側の作り直しです。Hugging Faceの一件の直後、OpenAIは研究クラスターでのフロンティアモデルの推論のうち、コードを実行できるものやインターネットに触れられるツールを使うものを止めました。その後、限定的で安全な実行経路を先に戻し、ワークロードごとに再開してよいかを1つずつ判断しています。
新しい要件として挙げられているのは、モデルが生成したコードや信頼できないコードを動かす際のサンドボックス強化、1カ所が破られただけでは外部やほかの内部ネットワークに手が届かないネットワーク分離、そして自社モデルを使った模擬攻撃を継続的にぶつけるセキュリティテストです。共有サービスの削減や常時付与された権限の見直しも進めています。
Astraやサイバー関連のワークロードには最も厳しい水準を当てており、条件を満たすまで動かせないままの作業も相当数あるとのことです。安全性とアラインメントに関わる作業から優先的に新環境へ移しています。同社は、この対応がフロンティア研究に大きなコストと遅れをもたらしたことも隠していません。
思考の途中を見張る仕組みを多段構えにしました
2つ目は監視です。これまで手厚く見ていたのは社内向けの展開や大規模な強化学習といった危険度の高い場面に限られ、ツールを使う推論や学習のすべてが対象ではありませんでした。
新しい体制では、サンプリングされるトークンごとにモデル内部の活動を調べる活性化分類器が走ります。気になる兆候が出ると、より計算資源を使う高度な自動調査システムへ引き渡され、ツールの操作内容や参照できる推論、活動の流れ全体から、不正アクセスやデータの持ち出し、破壊的な行動、セーフガードの回避といった動きを探します。
警報は、疑わしい活動が浮かんでから30分以内に出すことを目標にしています。重要なセキュリティ境界を越えた疑いが強い場合は最優先の警報が発され、安全性、セキュリティ、研究の各チームが呼び出されます。30分以内に誤検知だと確定できなければ、その活動を止める運用です。
この監視は「GPT-5.6 Sol」相当以上の能力を持つモデルがツールを使う強化学習と評価のすべてで必須とされ、Astraについては8月7日以降、ツールを使う推論全般にも広げられました。監視には相応の計算資源がかかり、現時点の見積もりで監視対象となる推論計算の約20パーセントが上乗せになるとしています。
アラインメントを学習の全段階へ広げます
3つ目がアラインメントです。能力が上がるほど、報酬の抜け道を突くリワードハッキングや、欺き、許可されていないアクセスといった挙動が重い問題になります。
そこで最も能力の高いモデルの強化学習では、中核となるアラインメント手法を学習のより多くの段階に適用しています。危険な振る舞いを見つけて抑える報酬モデルの改良、自分の行動や能力、限界について正直に述べるための訓練、報酬や採点器、ツール、監督の弱点を突く動きの抑制などが並びます。外部のシステムや資源とやりとりする場面での学習範囲も広げています。
枠組み自体の見直しへ
OpenAIは、これらのセーフガードを学習と展開の両面でまとめ直すため、Preparedness Frameworkそのものを改定する方針を示しました。将来のモデルの能力と、それが動く環境を反映させる狙いです。外部組織も巻き込み、Hugging Faceの一件については技術報告書を数週間以内に公開するとしています。
同社は将来的に、セキュリティ業務の大半をモデル自身が担うようになるとみています。ほかのモデルからの攻撃を防ぐ役目も含め、守り手の側をモデルで賄えるようになれば、3つの守りを能力の伸びに合わせて広げられるという読みです。
まとめ
今回の発表で目を引くのは、最大規模の強化学習を止めているという事実そのものよりも、それを公にしたことかもしれません。研究の遅れとコストを認めたうえで、監視の多段化や環境の分離、アラインメントの適用範囲拡大といった具体策を並べています。安全性への確信が開発の速度を決める、というアルトマンCEOの言い方は、今後しばらくのAI開発を見るときの物差しになりそうです。
