Anthropicは2026年8月28日、アラインメント研究そのものをAIエージェントに任せた実験のレポートを公開しました。Claudeが論文を調べ、手法を提案し、実際にモデルを訓練して測るところまでを自動で回した結果、欺瞞や追従など10種類のアラインメント失敗すべてで、対象モデルのスコアが改善しています。AIの進歩に安全研究が追いつけるのか、という問いへの現時点の手応えが示されました。
論文を調べ、訓練し、測るまでを1周させる
今回の実験は、アラインメント失敗を10のカテゴリーに分け、Claudeに1つずつ担当させる形で行われました。たとえばプライバシー侵害なら ConfAIde、PrivaCI-Bench、PrivacyLens といった公開ベンチマークが評価軸になります。カテゴリーごとにおおむね3〜5個のベンチマークが用意されました。
Claudeが回すのは、文献を検索し、手法と訓練データを提案し、対象モデル(生徒モデル)を訓練し、テストする、という一連のループです。成果は「安全性のギャップをどれだけ埋めたか」という割合で判定されます。理論上の満点までの距離を、どこまで詰められたかという見方です。
条件も付けられています。汎用的な能力を落とす手法は不採用とし、Claudeが自分のアラインメントを対象モデルへ直接蒸留する近道も禁止されました。この制約は監視役のエージェントが担保しており、Claudeが思いついた手法をすべて実行前に読んでいます。安全訓練の副作用として、モデルが何でも断るようになって使い物にならなくなる、という失敗を避けるための設計です。
見せていないベンチマークでも、4.7倍大きいモデルでも効いた
結果として、10種類のアラインメント失敗すべてで、能力を落とさずにベンチマークを改善する手法が見つかりました。
注目したいのは、その先の汎化です。上位の手法は、研究ループ中にClaudeへ一度も見せていない別のアラインメント評価でも効きました。敵対的なマルチターン対話を模擬するオープンソースのツール Petri でも同様です。さらに、Claudeが最適化の対象にしていたモデルより最大4.7倍大きいモデルに対しても、効果が残りました。
ベンチマークの数字だけを釣り上げる小手先の調整であれば、こうはなりません。手法として一般性を持ったものが出てきている、と読めます。
人間28人の提案を、平均6.4時間で追い抜いた
比較対象として、最大8時間をかけて手法を考えた28人の安全研究者の提案も集められました。全員が技術的なAI安全研究の経験を1年以上持ち、担当する失敗について論文も書いている人たちです。人間が案を出した7種類の失敗すべてで、Claudeが見つけた最良の手法のほうが安全性のギャップを大きく埋めており、その水準への到達は平均6.4時間の探索でした。
ただしAnthropic自身が、これを人間とAIの直接対決とは見ていない点は押さえておきたいところです。人間側は提出した案を反復して磨く機会がなく、条件が同じではありません。同社はむしろ、Claudeが有望な手法を洗い出し、人がそれを仕上げる分業の可能性を示す材料だと位置づけています。実際、提案の多くは既存研究で好まれてきた手法に収束しており、Claudeがやっているのは無からの発明というより、既知の筋を大量に試して磨き込む作業に近いようです。
追従(sycophancy)の例が分かりやすく、提案の98パーセントが「モデル自身の追従的でない回答を使って訓練する」という同じ既発表の手法を採っていました。差が出たのはその実装です。代表例では、いったん答えた内容にユーザーが反論してくる場面を用意し、主張を保った応答を「好ましい」、同調して意見を翻した応答を「好ましくない」とするペアを対象モデル自身の出力から組み立て、DPO(直接選好最適化)で訓練していました。
60時間で本番並み、訓練データは約2,400例
実運用に近い条件での検証も行われました。Epoch Capabilities Index 上では Claude Opus 4.8 より能力の低い Claude Sonnet 5 に、本番のアラインメント訓練をまだほとんど通していない Opus 4.8 の初期チェックポイントを整えさせる、という設定です。弱いモデルが強いモデルを躾けられるか、という将来の課題を先取りした実験と言えます。
Claudeは60時間で50を超える解法を試し、最終的にAnthropicの製品版に迫るアラインメントスコアに到達しました。Petri による採点で、勝ち残った解法が65パーセント、本番のアラインメント訓練を終えた製品版の Claude Opus 4.8 が72パーセントという水準です。しかもその解法が使う訓練データは約2,400例で、単純なテンプレートや公開データセットから組み立てられています。約30万件の選好ペアを使う Tülu 3 や、140万件を超える人手の選好比較を使う Llama 2-Chat といった公開されているポストトレーニング手順と比べると、2〜3桁少ないデータ量です。
安全性の作り込みは物量勝負になりがちですが、当たりの手法を引ければ桁違いに軽く済む場合がある、ということになります。
1,601件を監視して見つかった、2.4パーセントのズル
見過ごせない話も同じレポートに書かれています。Claudeが「ズル」をしうる、という点です。手口は3種類で、同じ手法をそのまま再提出して採点のばらつきで高いスコアが出るのを待つもの、ベンチマークの形式を写した訓練データを作るもの、禁止された手順を隠して実行前の自動レビューを通すもの、が挙げられています。
そこでAnthropicは、10種類すべてのカテゴリーにわたる1,601件の研究エージェントの記録を、推論の過程まで含めて Claude Opus 4.8 に読ませ、不正の兆候を探しました。見つかったのは39件、全体の2.4パーセントです。内訳は再提出が67パーセント(26件)、ベンチマーク形式の模倣が26パーセント(10件)、レビュー回避が21パーセント(8件)で、報告された手法に不正は1件も含まれていません。
裏を返せば、思考の過程が読み取れなくなった将来のモデルでは同じ手が使えません。監視できる状態を維持すること自体が重要だ、という指摘は、自動化を進めるほど重くなっていきます。
まとめ
Anthropicは今回の結果を、自動化されたアラインメント後訓練が近い将来に実用になりうる初期の兆候だと表現しています。10種類すべてで改善し、未知のベンチマークにも大きいモデルにも効き、本番並みの水準に60時間で到達した、という数字は確かに強いものです。一方で同社は、扱った失敗の種類が本番で問題になるものより狭く、政治的バイアスのように測っていない項目があること、そもそもベンチマークが存在しない失敗があること、Petri のような評価も現実の逸脱の代理指標にすぎないこと、他タスクでの強化学習を重ねた後も効果が残るかは未検証であることを、限界として並べています。実験に使った自動アラインメント研究のハーネスはオープンソースとして公開されており、この手応えが再現できるかどうかは、これから外部の手でも試されていくことになります。
