Googleが8月21日、公式ブログで「フルスタックAI」という言葉の意味を解説する動画を公開しました[1]。解説役はGoogle DeepMindでエンジニアリングリードを務めるPaige Bailey氏で、インフラ、セキュリティ、研究、モデルとツール、プロダクトという5つの層を挙げ、それぞれの役割と相互の関係を整理しています。Web開発の文脈で使われてきた言葉が、AI企業の競争力を語る枠組みへと拡張されつつあります。
Web開発から借りてきた言葉
フルスタックという表現は、もともとWeb開発の世界で使われてきたものです。画面まわりのフロントエンドと、サーバーやデータベースを扱うバックエンドの両方を一人で、あるいは一つのチームで担える状態を指します。近年はコードを厳密に書かずAIに任せる、いわゆるバイブコーディングの流行とともに、この言葉を目にする機会が増えました[1]。
Googleが今回持ち出しているのは、その語をAI開発の全体像に当てはめた使い方です。モデルだけ、あるいはクラウドだけを提供する事業者と違い、チップの設計から利用者が触れるアプリまでを自社で押さえている状態を指しています[1]。
Googleが挙げる5つの層
動画でBailey氏が挙げているのは、インフラ、セキュリティ、研究、モデルとツール、プロダクトの5つです[1]。
インフラは計算資源と、それをつなぐネットワークやストレージです。セキュリティは、学習と推論の両方で扱うデータや権限を守る土台にあたります。研究は新しい学習手法やアーキテクチャを生み出す部分で、モデルとツールはその成果を実際に動く形へ落とし込み、開発者が呼び出せるAPIやSDKとして整える層です。そしてプロダクトが、検索やGeminiアプリのように利用者が直接触れる出口になります[1]。
Googleの主張は、この5つが個別に優秀であることではなく、5つがかみ合って初めて速度と安全性と有用性が同時に成立する、という点にあります[1]。研究で生まれた手法をすぐ自社のチップに合わせて最適化できる、あるいはプロダクト側で見えた課題を研究に折り返せる。垂直統合の利点はそこにあるという整理です。
インフラ層で実際に起きていること
抽象論だけでは分かりにくいので、最下層のインフラを具体例で見ておきます。Googleは2026年4月のCloud Next 26で第8世代のTPUを発表し、学習向けのTPU 8tと推論向けのTPU 8iに初めて用途を分けました[2]。
TPU 8tはInter-Chip Interconnectにより1つのスーパーポッドで最大9,600基のTPUと2PBの共有広帯域メモリを束ね、前世代のIronwoodに対して3倍の処理性能と最大2倍の電力あたり性能を実現するとしています[2]。推論向けのTPU 8iは新しいBoardflyトポロジーで1ポッドあたり1,152基を直結し、オンチップSRAMを3倍に増やしてKVキャッシュをシリコン上に収める設計です。前世代比で80パーセント良い費用対性能をうたっています[2]。
あわせて、毎秒10TBのスループットを持つManaged Lustreや、大規模構成向けのVirgo Networkingといった周辺技術も同時に更新されました[2]。研究成果を載せる器そのものを自社で設計し直せることが、フルスタックを名乗る根拠になっているわけです。
数字で見る利用の広がり
Google Cloudの顧客の約75パーセントが同社のAI製品を業務に使っており、過去12か月で1兆トークン超を処理した顧客は330社、10兆トークンに達した顧客は35社にのぼります[2]。自社モデルがAPI経由で処理するトークンは毎分160億を超え、前四半期の100億から増えています[2]。
こうした規模で回すには、モデルの賢さだけでは足りません。単価と遅延を同時に下げる必要があり、それがTPU 8iのような推論専用チップに投資する動機になっています。5層のうち1つでも欠けると、残りの層が持つ利点を出し切れない構造だと言えます。
まとめ
Googleが公開した解説動画は、フルスタックAIをインフラ、セキュリティ、研究、モデルとツール、プロダクトの5層として定義し、その連携が製品の速度と安全性と有用性を支えていると説明しています。実際、第8世代TPUのように最下層の刷新が上位層の選択肢を広げる例は出てきています。競合との比較で自社の立ち位置を語る言葉として、フルスタックという表現はしばらく使われ続けそうです。
出典:https://cloud.google.com/blog/topics/google-cloud-next/welcome-to-google-cloud-next26
