Googleは、AI開発環境「Google Antigravity」に組み込まれたマルチエージェント機能「Teamwork」の大型アップデートを発表しました。複数のAIエージェントが互いの案を批判し合いながら数時間から数日かけて作業を続ける仕組みで、理論計算機科学の未解決問題7件の解決、OSを起動できるRISC-V CPUシミュレータの構築、C++ライブラリ「Eigen」への最適化の取り込みといった成果が報告されています。注目すべきは、これらの一部を軽量モデルの「Gemini 3.7 Flash」で再現できた点です。

「1体の賢いAI」ではなく「チームで詰める」設計

Teamworkは、Google I/Oで初めて披露されたAntigravityの機能で、有料プランの利用者であれば「/teamwork-preview」コマンドから呼び出せます。Googleの説明によると、単純にエージェントを複数並べただけの構成は、難しい研究課題になると早い段階の誤りに全員が同調してしまい、間違った前提の上に自信たっぷりに積み上げてしまう傾向があるとのことです。

そこでTeamworkでは、「候補を作る」「それを壊しにかかる」「生き残った要素を組み合わせる」という研究や開発でおなじみのループを明示的に組み込んでいます。目標の設定と最終的な受け入れ判断は人間が握ったまま、その間の反復だけを自動化するという分担です。

チームの編成は「パターン」と呼ばれる設計図で定義されます。現在用意されているのは、分割しにくい課題をテストと修正の短いループで詰める「Iterative Coding」、分割できる開発作業を並列のワーカーと批評役に振り分ける「Distributed Coding」、数学や理論計算機科学向けの「Long Proof」、1ステップごとに厳密な自己検証を挟む「Self-Verification」、論文や技術文書を構造的に批評する「Document Review」の5種類です。どのパターンを使うかは、入力されたプロンプトをGeminiが解析して自動で選びます。

パターンは実行コードではなく仕様として記述されており、フレームワーク側がそれを読んで必要なエージェントを立ち上げます。エージェントの数はあらかじめ固定されておらず、課題の様子に応じて実行中に増減する点も特徴です。

未解決問題7件と「TCSBench」71パーセント

最も目を引くのは数学分野の結果です。Long Proofパターンは、多数の証明戦略を並列に生成し、それぞれに「反証専門」のエージェントを付けて穴を探させたうえで、生き残った案を統合ツリーで組み合わせる構造になっています。反証された案も、その反論を添えたまま手元に残す設計で、失敗した経路の中にも使えるアイデアがあるという考え方です。選ばれた戦略はさらに依存関係付きの小問題に分解され、独立した部分は並列に、依存する部分は順番に処理されます。

この仕組みで解決したとされる問題は7件で、FOCSやJMLRといった主要な研究発表の場で提示された未解決問題が含まれます。具体的には、ℓp部分空間近似のコアセット構築、スパースな凸最適化における条件数の下界、多ベクトル埋め込みの類似度計算に関する複雑性、LLM向けアダマール量子化の理論保証、エルデシュの単位距離問題に関する既存の突破口の独立再現、プレフィックス行列分解の下界、そしてクヌースのサイクル予想の偶数ケースにおける2つの構成に対する初の証明です。

結果は専門家の人間による確認を経ており、クヌースのサイクル予想については40ページ超の証明を定理証明支援系のLeanで形式検証したと説明されています。7件のうち5件は論文としてarXivに公開済みです。

なお、これらの結果自体は上位モデルの「Gemini 3.1 Pro」で得られたものですが、そのうち3件はGemini 3.7 Flashでも再現できたとしています。Googleは、Flash級のモデルが適切な協調の枠組みを与えられることで博士レベルの数学研究を成し遂げたのは初めてだと強調しています。

ベンチマークでも、理論計算機科学の難問を集めた社内評価「TCSBench」において、Gemini 3.7 FlashとGemini 3.1 Proを組み合わせたLong Proofパターンが71パーセントを記録しました。同ベンチマークの論文で報告されていたGemini 3.6 FlashとGemini 3.1 Proの組み合わせによる67.7パーセントを上回り、社内テストでは最高値とのことです。FlashとProを1つのパターン内で組み合わせる機能は、今後のアップデートで提供される予定です。

OSが起動するRISC-VシミュレータをFlashだけで構築

システム分野では、Gemini 3.7 FlashのみでサイクルレベルのアウトオブオーダーRISC-V CPUシミュレータをゼロから構築した事例が紹介されています。完成したシミュレータは教育用OS「xv6」をシェルまで起動でき、100種類以上のRISC-V標準ベンチマークも動作します。

開発は2段階に分かれており、まずアウトオブオーダーパイプラインやリオーダーバッファなどの実行ロジックを作り込んで機能的な正しさを確保し、次にサイクル単位のタイミングを実機相当の基準に合わせ込みました。検証はオープンソースのRISC-Vプロセッサ「BOOM」の実行結果を正解として行い、未知のワークロードに対する平均サイクル誤差は0.71パーセントに収まったとしています。

この種のシミュレータ開発では、内部状態が静かにずれ始めてから目に見える故障として現れるまでに数百サイクルの「空白」が生じることが難しさになります。Teamworkは参照用シミュレータ「Spike」と常時ロックステップで突き合わせる方法でこの問題に対処しました。不正を防ぐため、Spikeのソースコードには直接アクセスできないよう隔離した環境で作業させたとのことです。

EigenとParlayHashへの最適化が本家に採用

オープンソースへの貢献も具体的です。Googleの内外で広く使われている線形代数ライブラリ「Eigen」に対しては、ベンチマークを壊さないという条件だけを与えて自由に最適化させたところ、行または列が1つしかない行列とベクトルの積(GeMV)の処理に非効率な部分を見つけ、直接的なデータアクセスとSIMD命令、4系統のアキュムレータ展開を使う専用の高速パスを実装しました。この変更は通常のコードレビューを経て、上流のEigenに取り込まれています。

並行ハッシュテーブル「ParlayHash」については、Swiss Tableの手法を取り入れた「Swiss Parlay」の着想に貢献しました。64スレッドでの初期挿入スループットが2倍、シングルスレッドでも全体で1.5倍になり、逐次処理向けの高速なテーブルに迫る性能を要素あたり25パーセント少ないメモリで達成したとされています。こちらも上流のリポジトリに反映済みです。

まとめ

Google Antigravityの「Teamwork」は、複数のAIエージェントが批判と統合を繰り返す枠組みを「パターン」として使い分けることで、未解決の数学問題7件の解決、OSを起動できるRISC-V CPUシミュレータの構築、EigenやParlayHashへの最適化の採用といった成果を上げました。軽量なGemini 3.7 Flashでも複数の結果を再現できた点は、モデル単体の賢さだけでなく協調の設計が成果を左右することを示しています。Teamworkの改良は今後数週間かけてAntigravityの「/teamwork-preview」に順次展開される予定です。