Google 於 8 月 21 日在官方部落格發布一段影片,說明「全端 AI」這個說法到底指什麼[1]。講解者是 Google DeepMind 的工程主管 Paige Bailey,她把這個概念拆成基礎設施、安全、研究、模型與工具、產品五個層次,並說明各層的作用與彼此的關係。一個原本屬於網頁開發的詞彙,正被延伸成描述 AI 企業競爭力的框架。
一個從網頁開發借來的詞
全端最早出現在網頁開發領域,指一個人或一支團隊既能處理使用者看得到的前端,也能處理伺服器與資料庫所在的後端。近來隨著所謂 vibe coding 流行,開發者更常仰賴 AI 而非逐行手寫程式,這個詞出現的頻率也跟著提高[1]。
Google 這次是把它套用到 AI 開發的整體樣貌上。與只提供模型或只提供雲端運算的業者不同,Google 從晶片設計一路到使用者直接開啟的應用程式都掌握在自己手上[1]。
Google 列出的五個層次
Bailey 提到的是基礎設施、安全、研究、模型與工具、產品[1]。
基礎設施涵蓋運算資源,以及把運算資源串起來的網路與儲存。安全是保護訓練與推論兩端資料與權限的基座。研究負責產出新的訓練方法與架構,模型與工具則把這些成果落實成可運作的形態,整理為開發者能夠呼叫的 API 與 SDK。產品則是使用者直接接觸的出口,例如搜尋或 Gemini 應用程式[1]。
Google 的主張並不是各層單獨優秀,而是五層彼此咬合之後,速度、安全性與實用性才可能同時成立[1]。研究中誕生的方法可以立刻針對自家晶片最佳化,產品端浮現的問題也能回流到研究。垂直整合的價值就在這裡。
基礎設施層實際發生的變化
只談抽象概念不易判斷,不妨看看最底層的具體動作。在 2026 年 4 月的 Cloud Next 26 上,Google 發表第八代 TPU,並首次依用途拆分為訓練用的 TPU 8t 與推論用的 TPU 8i[2]。
TPU 8t 透過晶片間互連(ICI),在單一超級節點中串連最多 9,600 顆 TPU 與 2PB 共享高頻寬記憶體,處理效能達到前一代 Ironwood 的 3 倍,每瓦效能最高提升至 2 倍[2]。推論用的 TPU 8i 採用新的 Boardfly 拓撲,在單一 pod 內直接連接 1,152 顆晶片,晶片內 SRAM 增加為 3 倍,使 KV 快取能夠完全放在矽晶片上。Google 表示其推論的每一元效能比前一代高出 80%[2]。
搭配的技術也同期更新,包括吞吐量達每秒 10TB 的 Managed Lustre,以及面向超大規模部署的 Virgo Networking[2]。能夠自己重新設計承載研究成果的容器,正是自稱全端的現實依據。
支撐這個說法的規模
約 75% 的 Google Cloud 客戶已在業務中使用該公司的 AI 產品。過去 12 個月間,有 330 家客戶各自處理超過 1 兆 token,35 家達到 10 兆[2]。Google 自家模型透過 API 直接呼叫處理的 token 已超過每分鐘 160 億,高於前一季的 100 億[2]。
以這種規模運轉,光靠模型聰明並不夠,成本與延遲必須同時下降,這正是投入 TPU 8i 這類推論專用晶片的動機。五層之中少了任何一層,其餘各層的優勢都無法完全發揮。
總結
Google 這段講解把全端 AI 定義為基礎設施、安全、研究、模型與工具、產品五個層次,並認為它們的咬合才撐起成品的速度、安全性與實用性。第八代 TPU 就是底層更新拓寬上層選項的實例。作為與對手對照時描述自身位置的說法,全端這個詞短期內還會繼續被使用。
來源:https://cloud.google.com/blog/topics/google-cloud-next/welcome-to-google-cloud-next26
