谷歌在 8 月 21 日于官方博客发布了一段视频,解释"全栈 AI"这个说法究竟指什么[1]。讲解者是谷歌 DeepMind 的工程负责人 Paige Bailey,她把这一概念拆成基础设施、安全、研究、模型与工具、产品五个层次,并说明各层的作用及彼此的关系。一个原本属于 Web 开发的词,正在被扩展成描述 AI 企业竞争力的框架。

一个从 Web 开发借来的词

全栈最早出现在 Web 开发领域,指一个人或一支团队既能处理用户可见的前端,也能处理服务器与数据库所在的后端。最近随着"氛围编程"(vibe coding)的流行,开发者更多依赖 AI 而非逐行手写代码,这个词的出现频率也随之上升[1]。

谷歌这次是把它套用到 AI 开发的整体图景上。与只提供模型或只提供云算力的厂商不同,谷歌从芯片设计一直到用户直接打开的应用都掌握在自己手里[1]。

谷歌列出的五个层次

Bailey 列举的是基础设施、安全、研究、模型与工具、产品[1]。

基础设施涵盖算力以及把算力连接起来的网络与存储。安全是保护训练与推理两端数据和权限的底座。研究负责产出新的训练方法与架构,模型与工具则把这些成果落成可运行的形态,整理为开发者可以调用的 API 与 SDK。产品是用户直接接触的出口,例如搜索或 Gemini 应用[1]。

谷歌的说法并不是各层单独优秀,而是五层咬合之后,速度、安全性与实用性才可能同时成立[1]。研究中诞生的方法可以立刻针对自研芯片做优化,产品端暴露出来的问题也能回流到研究。垂直整合的价值正在于此。

基础设施层实际发生的变化

只谈抽象概念不易判断,不妨看看最底层的具体动作。2026 年 4 月的 Cloud Next 26 上,谷歌发布了第八代 TPU,并首次按用途拆分为面向训练的 TPU 8t 与面向推理的 TPU 8i[2]。

TPU 8t 通过芯片间互连(ICI)在单个超级节点中连接最多 9,600 颗 TPU 与 2PB 共享高带宽内存,处理性能达到上一代 Ironwood 的 3 倍,每瓦性能最高提升至 2 倍[2]。面向推理的 TPU 8i 采用新的 Boardfly 拓扑,在单个 pod 内直连 1,152 颗芯片,片上 SRAM 增加至 3 倍,使 KV 缓存可以完全放在硅片上。谷歌称其推理性价比比上一代高出 80%[2]。

与之配套的技术也同期更新,包括吞吐量达每秒 10TB 的 Managed Lustre,以及面向超大规模部署的 Virgo Networking[2]。能够自己重新设计承载研究成果的容器,正是自称全栈的现实依据。

支撑这一说法的规模

约 75% 的谷歌云客户已经在业务中使用该公司的 AI 产品。过去 12 个月里,有 330 家客户各自处理了超过 1 万亿 token,35 家达到 10 万亿[2]。谷歌自有模型通过 API 直接调用处理的 token 已超过每分钟 160 亿,高于上一季度的 100 亿[2]。

以这种规模运转,仅靠模型聪明是不够的,成本与延迟必须同时下降,这正是投入 TPU 8i 这类推理专用芯片的动机。五层中缺少任何一层,其余各层的优势都无法完全释放。

总结

谷歌的这段讲解把全栈 AI 定义为基础设施、安全、研究、模型与工具、产品五个层次,并认为它们的咬合才支撑起成品的速度、安全性与实用性。第八代 TPU 就是底层刷新拓宽上层选择空间的实例。作为一种与对手对照时描述自身位置的说法,全栈这个词短期内还会被继续使用。

来源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/what-full-stack-development-means/

来源:https://cloud.google.com/blog/topics/google-cloud-next/welcome-to-google-cloud-next26