Google 宣布為 AI 開發環境「Google Antigravity」內建的多代理功能「Teamwork」推出大型更新。這套機制讓多個 AI 代理互相批評彼此的提案,並持續運作數小時到數天。Google 公布的成果包括:解決理論計算機科學領域的 7 道未解問題、打造出能啟動作業系統的 RISC-V CPU 模擬器,以及將最佳化程式碼合併進 C++ 函式庫「Eigen」。值得注意的是,其中部分成果可由輕量模型「Gemini 3.7 Flash」重現。
不是「一個更聰明的 AI」,而是「靠團隊逐步收斂」
Teamwork 是 Antigravity 在 Google I/O 首次亮相的功能,付費方案的使用者可透過「/teamwork-preview」指令呼叫。Google 說明,若只是單純把多個代理並排運作,遇到高難度研究課題時,它們往往會集體附和早期的錯誤,並在錯誤前提上信心十足地繼續堆疊。
因此 Teamwork 把研究與開發中常見的迴圈明確內建進來:產生候選方案、設法推翻它、再把存活下來的要素組合起來。目標設定與最終驗收仍由人類掌握,只有中間的反覆迭代交給自動化。
團隊的編組由稱為「模式」的藍圖定義。目前提供 5 種:針對難以拆解的問題、以測試與修正的短迴圈逐步逼近的「Iterative Coding」;將可拆解的開發工作分派給平行工作者並由批評者審查的「Distributed Coding」;面向數學與理論計算機科學的「Long Proof」;在每一步都加入嚴格自我驗證的「Self-Verification」;以及對論文和技術文件進行結構化批評的「Document Review」。要使用哪種模式,由 Gemini 解析輸入的提示後自動選擇。
模式是以規格而非可執行程式碼的形式撰寫,框架讀取後會自動啟動所需的代理。代理數量並未事先固定,會依問題的實際狀況在執行過程中增減。
7 道未解問題與「TCSBench」71%
最受矚目的是數學領域的成果。Long Proof 模式會平行產生大量證明策略,為每個策略配置專門負責「反證」的代理來尋找漏洞,再透過綜合樹把存活下來的方案組合起來。被反證的方案也會連同反對意見一起保留,因為失敗的路徑中仍可能藏有可用的想法。選定的策略會進一步拆解為帶有相依關係的子問題,獨立的部分平行處理,有相依關係的部分則依序處理。
Google 表示透過這套機制解決了 7 道問題,其中包含在 FOCS、JMLR 等主要學術場合提出的未解問題。具體包括:ℓp 子空間近似的核心集構造、稀疏凸最佳化中條件數的下界、多向量嵌入相似度計算的複雜度、面向 LLM 的 Hadamard 量化理論保證、對 Erdős 單位距離問題既有突破的獨立重現、前綴矩陣分解的下界,以及 Knuth 循環猜想偶數情形下兩種構造的首個證明。
這些結果經過人類專家審核,其中 Knuth 循環猜想超過 40 頁的證明已在定理證明工具 Lean 中完成形式化驗證。7 項成果中有 5 項已以論文形式發表於 arXiv。
需要說明的是,這些結果本身是由更高階的「Gemini 3.1 Pro」得出,但其中 3 項也能以 Gemini 3.7 Flash 重現。Google 強調,這是 Flash 等級的模型在獲得合適的協作框架後,首次完成博士等級的數學研究。
在基準測試方面,結合 Gemini 3.7 Flash 與 Gemini 3.1 Pro 的 Long Proof 模式,在彙整理論計算機科學難題的內部評測「TCSBench」中取得 71% 的成績,高於該基準論文中 Gemini 3.6 Flash 與 Gemini 3.1 Pro 組合的 67.7%,也是 Google 內部測試的最高分。在同一模式中結合 Flash 與 Pro 的功能,預計於後續更新提供。
僅用 Flash 打造出能啟動作業系統的 RISC-V 模擬器
在系統領域,Google 介紹了僅使用 Gemini 3.7 Flash 從零打造週期級非循序執行 RISC-V CPU 模擬器的案例。完成的模擬器能把教學用作業系統「xv6」啟動到 shell,並可執行 100 多種 RISC-V 標準基準測試。
開發分為兩個階段:先建構非循序管線、重排序緩衝區等執行邏輯以確保功能正確,再把週期級時序對齊到相當於實體硬體的基準。驗證以開源 RISC-V 處理器「BOOM」的執行結果為真值,在未見過的工作負載上平均週期誤差為 0.71%。
這類模擬器開發的難處在於「靜默執行間隙」:內部狀態開始悄悄偏離後,可能要經過數百個週期才會表現為看得見的故障。Teamwork 以與參考模擬器「Spike」持續鎖步比對的方式因應這個問題。為了防止作弊,Spike 的原始碼被隔離,代理無法直接存取。
Eigen 與 ParlayHash 的最佳化獲上游採納
對開源專案的貢獻也相當具體。針對 Google 內外廣泛使用的線性代數函式庫「Eigen」,團隊只給出「不得破壞基準測試」這一個條件便讓其自由最佳化。Teamwork 發現矩陣僅有單列或單欄時的矩陣向量乘法(GeMV)存在低效之處,隨即實作採用直接資料存取、SIMD 指令與 4 路累加器展開的專用快速路徑。這項修改經過一般的程式碼審查後,已合併進上游的 Eigen。
針對並行雜湊表「ParlayHash」,Teamwork 參與了引入 Swiss Table 技術的「Swiss Parlay」構想。據稱 64 執行緒下的初始插入吞吐量提升至 2 倍,單執行緒整體吞吐量提升至 1.5 倍,並以每個元素少 25% 的記憶體達到接近最快循序雜湊表的效能。這項改動同樣已反映到上游程式庫。
總結
Google Antigravity 的「Teamwork」透過依需求切換多個 AI 代理反覆批評與整合的「模式」,達成解決 7 道數學未解問題、打造能啟動作業系統的 RISC-V CPU 模擬器,以及最佳化獲 Eigen 與 ParlayHash 採納等成果。多項結果能以輕量的 Gemini 3.7 Flash 重現,顯示協作機制的設計與單一模型的能力同樣左右最終成果。Teamwork 的改進將在未來數週內陸續推送至 Antigravity 的「/teamwork-preview」。
