Waymo 于 8 月 20 日首次公开了自家 Robotaxi 车载计算平台的内部构成。核心是一颗自研的 5nm 专用集成电路,仅用于承接摄像头与激光雷达原始数据的前端处理,就具备超过 1000 TOPS 的机器学习性能。这意味着一直依靠现成器件行驶的自动驾驶车队,正式进入了自造芯片的阶段。
在原始数据的入口放一颗专用芯片
这次公开的 ASIC 并非通用运算单元,而是专为实时处理和融合传感器原始数据、并在其上运行神经网络而设计的处理器。它配备了专用加速器,可以从激光雷达、毫米波雷达和摄像头的数据流中直接提取关键信息,输出再交给后端的专用推理引擎,运行传感器融合模型。
仅前端处理就分配到 1000 TOPS 以上,这个数字本身已经相当可观,但 Waymo 强调的并不是峰值。自动驾驶实际面对的是每次输入量较小的低批量处理场景,官方表示,他们连同软件在内做了全栈优化,目标是把这种条件下实际达成的性能拉到最高。
低光照环境下的感知能力同样受益。芯片内置了时域降噪机制,最新系统可以同时实时处理 13 台高分辨率摄像头的画面,捕捉传统摄像头在暗处会丢失的细节。
为压缩毫秒级延迟而定下的设计思路
Waymo 为车载计算平台列出了 3 项要求。第一项是响应速度。自动驾驶的判断必须在车内完成,不能依赖网络,因此从画面输入到车辆动作之间的延迟直接关系到安全性。官方表示,过去 8 年里原始算力提升了 20 倍,同时在软件层面也压低了延迟的整体分布。
支撑这些的是超过 2 亿英里的无人驾驶经验。放在数据中心里都算得上可观的计算规模,却要塞进持续振动、温差巨大的车内并满足实时约束,Waymo 的做法是让硬件、传感器与算法并行协同设计。
出故障也不停车的双路结构
第二项要求是坚固性。车载计算平台长期承受振动与冲击,还要在严冬与酷暑之间往返。Waymo 将计算平台直接接入车辆的液冷系统,以保证环境变化时性能不会下滑。
第三项是冗余。车上没有可以接管的驾驶员,单路计算显然不成立。Waymo 的车载计算平台被设计成两台独立引擎的形态,正常情况下两路并行执行相同的工作负载,一旦其中一路出现故障,另一路会无缝接手。
与此同时,乘坐体验也被写进了设计条件。整体采用以机器学习为主的架构,而调度、数据搬运、日志记录等非机器学习任务则交给 CPU、GPU 和加速器,通过这种异构分工来兼顾能效、后备箱空间与静音表现。
不是闭门造车,细节将在 Hot Chips 公布
自研芯片听上去像是垂直封闭,但 Waymo 同时列出了合作伙伴,包括 AMD、Micron、NVIDIA、SAMSUNG、Sandisk、Socionext 和 TSMC 共 7 家。哪些部分自己做、哪些部分采用成熟的外部技术,公司划出了清晰的分界。
这次公布仍属于概要,更深入的技术内容预计将在 8 月 23 日开幕的半导体技术会议 Hot Chips 的演讲中揭晓。在 Robotaxi 的竞争普遍以车队规模和覆盖城市数量来衡量的当下,底层计算平台的打磨终于被摆到了台面上。
总结
Waymo 公开的是一颗面向传感器原始数据处理的 5nm ASIC,以及围绕它构建的车载计算平台设计思路。仅前端处理就超过 1000 TOPS、8 年内算力提升 20 倍、直接接入车辆液冷、依靠两路独立结构实现冗余,这些都是从无人驾驶在真实道路上持续运行的现实需求反推出来的结果。更多细节有望在 Hot Chips 的演讲中公布。
