Googleが、自社の生成AI「Gemini」を動かすことだけを考えた専用チップを開発しているとの報道が出ました。開発コード名は「Frozen v2」。モデルの内部構造そのものをシリコンに刻み込むという設計で、電力あたりの処理能力は現行のTPUと比べて6倍から10倍に達すると見込まれています。データセンターへの投入は2028年からとされています。
汎用チップから「1つのモデル専用」へ
AI向けの半導体は、これまで汎用性を残す方向で作られてきました。Googleが長年クラウドで提供してきたTPUも、学習向けと推論向けにそれぞれ最適化はされているものの、基本的には多様なモデルを動かせる設計です。汎用であることは強みですが、裏を返せば、特定のモデルにとっては不要な回路も抱え込むことになります。
Frozen v2はその前提を外します。Geminiのアーキテクチャ、つまりモデルがどういう計算をどんな順序で並べているかという設計図の部分を、あらかじめハードウェア側に固定してしまう。汎用性を捨てる代わりに、1つのモデルを動かすときの無駄をほぼゼロに近づけようという発想です。名前の「Frozen(凍結された)」は、この作りをそのまま言い表したものといえます。
なお、この構想はGoogle DeepMindの主任科学者であるJeff Dean氏から出たものと伝えられています。
重みではなく「構造」を固定した理由
興味深いのは、Googleが当初検討していたとされる案を取り下げている点です。もともとはモデルの重み、つまり学習で得られたパラメータそのものをチップに焼き込む案があったものの、それでは特定バージョンのGeminiでしか動かせず、モデルが更新された瞬間に陳腐化してしまいます。半導体の開発と製造には年単位の時間がかかりますから、これは致命的です。
そこで固定する対象を、変わりやすい重みではなく、比較的変わりにくい構造のほうに寄せた、というのが今回の設計です。モデルの世代が変わっても骨格まで作り替えられることは多くない、という読みが前提にあります。逆にいえば、この賭けはGeminiの基本設計が今後しばらく大きく揺れないことを織り込んでいるわけで、そこが当たるかどうかが評価の分かれ目になりそうです。
効率はどこから生まれるのか
6倍から10倍という数字の内訳として挙げられているのは、大きく2つです。
1つは計算回数そのものの削減です。複数の演算をまとめて1回の処理に統合する手法は、AIモデルの高速化では広く使われていますが、これをソフトウェア側で都度やるのではなく、回路の段階で織り込んでしまえば取りこぼしがなくなります。
もう1つはデータの移動を減らすことです。モデルがチップ上のメモリに収まりきらないと、外部のメモリとの間でデータをやり取りし続けることになり、この往復が処理速度の足を引っ張ります。Frozen v2にGeminiを丸ごと載せられるだけのメモリを積めれば、この往復自体が消えます。AI処理の消費電力は、実のところ計算そのものよりデータを動かす部分が重いといわれており、ここを削れる意味は小さくありません。
2028年という時間軸をどう見るか
報道を受けてAlphabetの株価は1.5パーセント上昇しました。ただ、投入は2028年からで、生産量もTPUの系列より小さくなる見込みとされています。位置づけとしては量産主力ではなく、専用チップという路線が本当に割に合うのかを確かめる試験台に近いようです。
現時点でGoogleはFrozen v2について公式に認めておらず、6倍から10倍という効率の数字も、実際のシリコンで測られたものではありません。この種の見通しが量産段階で目減りするのは珍しい話ではなく、そのまま受け取るのは早計でしょう。それでも、推論を動かし続けるコストが各社の重荷になっている今、モデルとチップを一体で設計するという方向自体は理にかなっています。GoogleはGemini 3.5 Proの投入が遅れている状況にありますが、AIを動かし続けるコストで差をつけられるなら、モデル単体の勝ち負けとは別の土俵で戦えることになります。
まとめ
Googleが開発中とされる「Frozen v2」は、Geminiのアーキテクチャをシリコンに固定することで、電力あたり6倍から10倍の効率を狙う推論向けチップです。重みではなく構造を焼き込むことで陳腐化を避け、計算回数とデータ移動の両方を削る設計とされています。データセンターへの展開は2028年から、生産規模はTPUより小さい見込みです。Googleは公式に認めておらず数字も未検証ですが、モデルとハードウェアを一体で設計する流れがどこまで進むのかを占う一手になりそうです。
