由哈佛大學、史丹佛大學、Together AI 與 Caltech 的 9 位研究人員組成的團隊,公開了讓 AI 程式撰寫代理掌握 GPU 專屬知識、進而自動產生並最佳化運算核心的框架 HAWKEYE。團隊在 NVIDIA 與 AMD 的 4 種 GPU 架構上進行驗證,於新型注意力運算上回報了幾何平均最高 18.9 倍的提速。
每出一顆新晶片,軟體就得重寫一次
AI 加速器幾乎每年推出新世代,但真正把效能榨出來的軟體每次都要重做。指令集變了、記憶體階層變了、快取的表現也變了,撰寫運算核心的人只能針對每一代重新調校。能做這件事的人本來就不多,晶片上市到軟體跟上之間的落差,直接反映成實際可用效能的損失。
讓大型語言模型來寫這類程式的嘗試並不新鮮,但底層 GPU 程式設計一直是弱項。模型能寫出語法正確的程式碼,卻缺少這裡真正關鍵的直覺,例如哪一處記憶體存取會成為瓶頸、哪道指令只在特定世代上跑得快。
HAWKEYE 要補的正是這個缺口。它的做法不是把厚重的技術文件或整套產品級運算核心直接丟給代理,而是把反覆出現的最佳化套路整理成體系交給它。
用大約 10 個單元測試來教,而不是靠手冊
團隊建立了一套分類體系,涵蓋向量化記憶體讀取、非同步資料搬移、warp 層級運算等常見的最佳化策略。代理依據這套分類判斷該出哪一手。
要讓系統支援新架構,人工需要準備的只有專家撰寫的大約 10 個單元測試與參考運算核心。之後代理會在能實際使用 GPU 的環境中編輯程式碼、執行、驗證正確性並進行效能剖析,再依照找出的瓶頸把多種最佳化組合起來。
從人的角度看,教學成本從「把所有資料讀完」縮減為「用測試點出關鍵」。需要支援的晶片種類越多,這個差距越明顯。
18.9 倍這個數字該怎麼讀
報告中的數值,意義會隨對象而不同。
在既有函式庫覆蓋較薄的 Linear Attention 等新型注意力運算上,相對 torch.compile 取得幾何平均 18.9 倍的結果。反過來說,差距之所以拉得這麼開,正是因為原本的實作並未充分最佳化。在一般的 BF16 運算上,相對 torch.compile 為 1.13 倍,低精度格式為 1.28 倍,量級明顯回落。並非所有 GPU 運算都會快上 18.9 倍,這點需要留意。
與專家手寫運算核心的比較則更貼近現實。相對以 Triton 實作的 Causal Linear Attention 為 0.92 倍,Forgetting Attention 為 1.05 倍,基本上與人類專家平分秋色,互有勝負。自動化的價值與其說是「超越人」,不如說是把同等品質的運算核心鋪到專家分身乏術的角落。
增加嘗試次數後還能不能繼續進步
另一個值得注意的結果,是給代理更多嘗試次數之後的表現。驗證使用了 Gemini 3.1 Pro 與 GPT-5.4。
共同第一作者之一的 Arya Tschand 表示,HAWKEYE 在反覆嘗試中持續改善,而直接提供硬體文件與複雜實作範例的做法很早就停止成長。資訊量堆得更多並不會讓代理變聰明,真正改變上限的是有沒有給它一個可供搜尋的結構。這是「餵給代理什麼」本身左右效能的具體例子。
總結
HAWKEYE 把 GPU 專屬的最佳化套路整理成分類交給 AI 程式撰寫代理,由其自動完成運算核心的最佳化。支援新架構所需的人力壓縮到大約 10 個單元測試與參考實作,團隊回報在新型注意力運算上相對 torch.compile 取得幾何平均 18.9 倍、在一般運算上取得 1.13 倍至 1.28 倍的改善。與專家手寫的運算核心大致持平,面向未知架構的首批測試與參考實作仍然需要專家知識。即便如此,作為縮短晶片世代交替與軟體跟進之間落差的一條路徑,這項成果值得關注。
