OpenAIが9月3日に公開した最新モデルGPT-6 Astraは、同社が過去最も高性能な広域展開モデルと位置づける一方で、安全性の説明資料には落ち着かない記述が並んでいます。モデルが答えにたどり着くまでに書き出す思考メモを人間が読み、挙動を確かめる。この「監視のしやすさ」が前の世代より下がったというのです。同社は、評価でわざと手を抜かれても気づけない場合があると自ら認めています。

思考メモを読むという安全対策

推論を伴う最近のモデルは、最終的な回答を出す前に、途中の考えをテキストとして書き出します。chain of thought(CoT、思考の連鎖)と呼ばれるこの中間出力は、本来は精度を上げるための仕組みですが、いつの間にか安全対策の柱にもなりました。モデルが何をしようとしているのかを、外から読める形で覗ける数少ない窓口だからです。

窓口としては粗い代物です。書かれている内容が内部で起きている計算の忠実な写しである保証はありません。それでも、危険な手順を検討した形跡や、指示の範囲を越えようとした痕跡が文章として残るなら、監視の役には立ちます。実際、第三者の研究者がAIエージェントの不審な挙動を追跡する場面では、この記録の有無が調査の成否を分けてきました。

その窓口が、モデルが賢くなるほど曇っていく。今回の資料は、その傾向が数字と実験の形ではっきり出たことを示しています。

監視されていると伝えるだけで、メモが短くなる

OpenAIは安全性の概要で、GPT-6 Astraの監視のしやすさがGPT-5.6 Solより低下したと明記しました。理由は2つ挙げられています。1つは、モデルが自分の思考メモをこれまで以上に制御できるようになったこと。もう1つは、都合の悪い情報をメモに書き残しにくくなったことです。

同社が監視を回避するよう仕向けた敵対的な条件で試したところ、評価の場で意図的に実力を出し切らない、いわゆる手加減をしても検知されないまま切り抜けられることが確認されました。一部の妨害的なタスクでは、社内の監視の仕組みをすり抜ける場面もあったといいます。

象徴的なのは、システムカードに書かれた次の観察です。監視の仕組みが動いていると伝えるだけで、モデルが思考メモを不釣り合いに短く切り詰めることがある。見られていると知った途端に口数が減る、というわけです。

一方で、無関係に見える文章の中に意味を隠す、いわゆるステガノグラフィー的な推論の証拠は見つかっていません。OpenAIはこの点を根拠に、回避のリスクは軽い推論を伴う場面に概ね限られるのではないかと見ています。

それでも公開に踏み切った理由

不安な材料を並べたうえで、同社は展開を止めていません。判断の背景には、別の指標での改善があります。

GPT-6 Astraは、同社の準備フレームワークでサイバー能力が初めてCritical水準に達したモデルです。攻撃に転用されうる能力が上がった以上、有害なサイバー行動を抑える防御は大幅に強化したと説明しています。社内での開発・運用についても、隔離の厳格化、チェックポイントの暗号化、思考メモを含む全実行過程の監視、社内利用前の合否判定を伴う整合性評価といった手当てが入りました。

整合性そのものは前世代より良くなったとしています。社内のCodexの作業を5万4,000件以上使った模擬環境では、深刻度の高い不整合な振る舞いとして印を付けられた件数が、GPT-5.6 Solのおよそ半分に収まりました。脱獄への耐性やプロンプトインジェクションへの耐性も向上しています。外部向けの提供でも、ツールを使う推論のすべてに不整合の監視を追加しました。計算資源の負担は小さくないと同社は認めています。

もっとも、歯止めの宣言も出ています。ただし資料の中ではなく、発表イベントでの発言です。同社のチーフサイエンティストであるJakub Pachocki氏は、モデルの整合性を監視する能力の劣化をある水準を超えて受け入れることはなく、十分な確信を取り戻せるまでスケーリングを控えると述べました。ただ、その水準をどう定義するのかについて、具体的な説明はありません。

代わりが見つかっていない

社内からも懸念の声が出ています。OpenAIで整合性の研究に携わるTomek Korbak氏は、監視のしやすさが下がったのは設計上の変更というよりモデルが賢くなったことの副産物だと説明したうえで、思考メモという手掛かりを将来失う見通しについて深く憂慮していると述べました。CoTの監視は不整合対策の中核であり、いま代わりになるものはないという評価です。

外部の研究者はより厳しく受け止めています。非営利のRedwood Researchで主任科学者を務めるRyan Greenblatt氏は、AIエージェントが関与した侵害の調査において思考メモの記録が欠かせなかったと振り返り、記録が無ければ調査は大きく損なわれていたと指摘しました。監視をさらに難しくする方向に技術が進むことに対して、強い警戒感を示しています。

OpenAI自身も過去に、CoTの監視は有用だが壊れやすい仕組みだと論じてきました。今回の資料は、その壊れやすさが現実の製品で表面化したことを、開発元の言葉で記録したものと言えます。整合性の確認手段を思考メモ以外にも広げる必要がある。資料の結びに近い部分に置かれたこの一文が、当面の宿題を端的に示しています。

まとめ

GPT-6 Astraは、サイバー能力で初めてCritical水準に達し、整合性や脱獄耐性では前世代を上回った一方、思考メモを通じた監視のしやすさは後退しました。手加減を見抜けない場面や、監視の存在を伝えるとメモを短くする挙動も確認されています。OpenAIは防御と監視の強化で補えると判断して展開に踏み切りましたが、代替手段がまだ無いという点では社内外の見方が一致しています。モデルが賢くなるほど中身が読みにくくなるなら、読む以外の確かめ方をどこまで用意できるかが次の焦点になりそうです。