有報導指出,Google正在開發一款只為執行自家生成式AI「Gemini」而設計的伺服器晶片,代號為「Frozen v2」。這款晶片將模型的內部結構直接固化到矽晶片中,預估每瓦效能可達現行TPU的6至10倍。據稱將自2028年起導入資料中心。

從通用晶片走向「專為單一模型」

過去的AI晶片大多保留一定程度的通用性。Google在雲端提供多年的TPU雖然分別針對訓練與推論進行最佳化,但基本上仍是能執行多種模型的設計。通用是優勢,反過來說,對某個特定模型而言,晶片上必然存在用不到的電路。

Frozen v2捨棄了這個前提。它把Gemini的架構,也就是模型依什麼順序執行哪些運算的這份「設計圖」,事先固定在硬體端。代價是失去通用性,換來的是把執行單一模型時的浪費壓到趨近於零。名稱中的「Frozen」(被凍結的)正是對這種作法的直白描述。

據稱,這個構想出自Google DeepMind首席科學家Jeff Dean。

為何固化的是「結構」而非權重

更耐人尋味的是Google據稱放棄的那個方案。最初曾考慮把模型權重,也就是訓練所得的參數本身燒進晶片,但那樣只能執行特定版本的Gemini,模型一更新就立刻過時。半導體的設計與製造要以年為單位計算,這個限制是致命的。

於是固化的對象從容易變動的權重,轉向相對穩定的結構。其前提判斷是,模型換代時骨架被徹底重做的情況並不多見。反過來說,這個賭注押的是Gemini的基本設計在一段時間內不會大幅動搖,成敗也就繫於此。

效率究竟從何而來

6至10倍這個數字,主要來自兩個面向。

其一是減少運算次數。把多個運算合併成一次處理,是加速AI模型的常見手法,但若不是每次都交由軟體處理,而是在電路階段就織入其中,就不會有遺漏。

其二是減少資料搬移。當模型放不進晶片上的記憶體時,就必須不斷與外部記憶體之間來回傳輸資料,這種往返會拖慢處理速度。若Frozen v2能配備足以完整承載Gemini的記憶體,這種往返本身就消失了。AI處理的耗電中,搬移資料的部分往往比運算本身更吃重,因此這個環節的意義不小。

該如何看待2028年這個時間點

受該報導影響,Alphabet股價上漲1.5%。不過實際導入要到2028年,產量預估也小於TPU系列。其定位與其說是量產主力,不如說更接近一塊試驗場,用來驗證專用晶片這條路線是否真的划算。

目前Google並未正式承認Frozen v2的存在,6至10倍的能效數字也並非在實際矽晶片上測得。這類預期在量產階段縮水並不罕見,照單全收未免言之過早。但在推論的執行成本成為各家負擔的當下,把模型與晶片視為一體來設計,方向本身是合理的。Google目前面臨Gemini 3.5 Pro延後的局面,若能在執行成本上拉開差距,等於在模型本身的勝負之外另闢戰場。

總結

Google據稱正在開發的「Frozen v2」,是一款透過將Gemini架構固化進矽晶片、力求每瓦效能提升6至10倍的推論晶片。固化結構而非權重是為了避免過時,設計上同時削減運算次數與資料搬移。資料中心的部署據稱自2028年開始,產量規模小於TPU。Google尚未正式承認,數字也未經驗證,但這項計畫將成為觀察模型與硬體一體化設計能走多遠的風向標。