来自哈佛大学、斯坦福大学、Together AI 和 Caltech 的 9 名研究人员组成的团队公开了 HAWKEYE,这是一套让 AI 编程智能体掌握 GPU 专有知识、从而自动生成并优化计算内核的框架。团队在英伟达和 AMD 的 4 种 GPU 架构上进行了验证,在新型注意力运算上报告了几何平均最高 18.9 倍的提速。
每出一颗新芯片,软件就要重写一遍
AI 加速器几乎每年都会更新一代,但真正把性能释放出来的软件每次都得重做。指令集变了,内存层级变了,缓存的行为也变了,写内核的人只能针对每一代重新调优。能做这件事的人本来就不多,芯片上市到软件跟上之间的时间差,直接体现为实际可用性能的损失。
让大语言模型来写这类代码的尝试并不新鲜,但底层 GPU 编程一直是弱项。模型能写出语法正确的代码,却缺少这里真正要紧的直觉,比如哪一处内存访问会成为瓶颈,哪条指令只在特定世代上跑得快。
HAWKEYE 要补的就是这个缺口。它的思路不是把厚厚的技术文档或整套生产级内核直接丢给智能体,而是把反复出现的优化套路整理成体系交给它。
用大约 10 个单元测试来教,而不是靠手册
团队构建了一套分类体系,涵盖向量化内存读取、异步数据搬运、warp 级运算等常规优化策略。智能体依据这套分类判断该出哪一手。
要适配一种新架构,人工需要准备的只有专家编写的大约 10 个单元测试和参考内核。之后智能体在能实际调用 GPU 的环境里编辑代码、运行、验证正确性并做性能剖析,再根据发现的瓶颈把多种优化组合起来。
从人的角度看,教学成本从「把所有内容读完」缩减为「用测试点出关键」。需要支持的芯片种类越多,这个差别越明显。
18.9 倍这个数字该怎么读
报告中的数值,含义随对象不同而不同。
在现有库覆盖较薄的 Linear Attention 等新型注意力运算上,相对 torch.compile 取得了几何平均 18.9 倍的结果。反过来说,差距之所以这么大,正是因为原有实现本就没有充分优化。在常规的 BF16 运算上,相对 torch.compile 为 1.13 倍,低精度格式为 1.28 倍,量级明显回落。并非所有 GPU 运算都会快 18.9 倍,这一点需要留意。
与专家手写内核的对比更贴近现实。相对用 Triton 实现的 Causal Linear Attention 为 0.92 倍,Forgetting Attention 为 1.05 倍,基本与人类专家打成平手,互有胜负。自动化的价值与其说是「超过人」,不如说是把同等质量的内核铺到专家顾不上的角落。
尝试次数增加后还能不能继续提升
另一个值得注意的结果,是给智能体更多尝试次数之后的表现。验证中使用了 Gemini 3.1 Pro 和 GPT-5.4。
共同第一作者之一 Arya Tschand 表示,HAWKEYE 在反复尝试中持续改进,而直接提供硬件文档和复杂实现示例的做法很早就停止了增长。信息量堆得更多并不会让智能体更聪明,真正改变上限的是有没有给它一个可供搜索的结构。这是「喂给智能体什么」本身决定性能的一个具体例子。
总结
HAWKEYE 把 GPU 专有的优化套路做成分类交给 AI 编程智能体,由其自动完成计算内核的优化。适配新架构所需的人工投入压缩到大约 10 个单元测试和参考实现,团队报告在新型注意力运算上相对 torch.compile 取得几何平均 18.9 倍、在常规运算上取得 1.13 倍至 1.28 倍的改进。与专家手写内核基本持平,面向未知架构的首批测试和参考实现仍然需要专家知识。即便如此,作为缩短芯片换代与软件跟进之间时间差的一条路径,这项成果值得关注。
