xAI 於當地時間 6 月 28 日開始向旗下的 SpaceX 與特斯拉提供全新 AI 助理「Grok 4.5」的非公開測試版。其核心採用了一款全新的、擁有 1.5 兆參數的基礎模型(可作為多種用途底座的大規模模型)「V9」。伊隆·馬斯克表示「早期評測顯示其效能接近、甚至可能超越 Anthropic 的頂級模型 Opus」,但該模型尚未對外公開,也沒有第三方對此進行驗證。與之一併揭露的「每月從零訓練並推出一款全新基礎模型」的計畫,同樣引發關注。
1.5 兆參數的全新基礎模型「V9」
支撐 Grok 4.5 的 V9,是 xAI 的第九代基礎模型,其預訓練(以海量資料打造模型底座的過程)已於 5 月 26 日完成。參數量為 1.5 兆,是目前在 X 與特斯拉車輛上量產運行的「v8-small」(5000 億)的 3 倍。
不過,規模擴大並不能直接決定效能。據稱在 V9 中,程式開發工具 Cursor 的作業資料並非在預訓練的最初階段加入,而是在其後的補充學習階段才加入。xAI 的工程師也承認「這不如從最初訓練就納入的效果好」,並說明下一款 2 兆參數的模型將在預訓練階段就納入 Cursor 的資料。換言之,剛進入測試的 Grok 4.5,可能帶有其後繼模型正著力解決的結構性弱點。
V9 針對 NVIDIA 的 Blackwell 世代 GPU 進行了最佳化,並在 xAI 位於田納西州孟菲斯的大規模運算基礎設施「Colossus」上完成訓練。據稱即便在非公開測試期間,強化學習(透過反覆試誤提升效能的方法)仍在持續改進該模型。
「接近 Opus」僅止於內部評測
馬斯克說法中值得留意的一點是,其依據的評測全部在內部進行。負責測試的 SpaceX 與特斯拉,皆隸屬於如今擁有 xAI 的同一家 SpaceX corporation,之間並不存在獨立的第三方。
此外,xAI 並未將現有世代的 Grok 提交給任何主流的第三方基準測試。在 AI 業界,開發方的自報數值與外部實測值之間出現落差的情況屢有所聞,某款模型的開發方曾在一項難題測試中宣稱 50%,而獨立研究者的實測僅為 29.4%。
比較的對象本身也在變動。在由獨立機構彙整 9 項評測算出的「Artificial Analysis Intelligence Index」中,目前由 Claude Fable 5、Claude Opus 4.8 等 Claude 系模型位居前列,Grok 並未上榜。在衡量程式撰寫能力的「SWE-bench Verified」中,運行於 Opus 4.7 之上的 Claude Code 取得了 87.6%,而 xAI 的舊款模型為 70.8%。V9 相較舊款模型確有進步,但只要既未公開也未提交基準測試,「接近 Opus」就仍是一個無法驗證的說法。
為何 SpaceX 與特斯拉優先
Grok 4.5 在面向大眾之前先交由內部使用,其背後是企業結構的變化。SpaceX 於 2026 年 2 月收購了 xAI,將火箭企業與 AI 研究機構合併為一個整體,合計估值達 1.25 兆美元(約 201 兆日圓)。※1 美元 = 161 日圓(截至 2026 年 7 月 3 日)
這場合併為模型開發帶來了特殊的循環。多數 AI 企業仰賴公開基準測試與模擬任務來檢驗模型,而 SpaceX 與特斯拉所產生的是實務本身的負荷——衛星的軌道計算、車輛的製造流程、數千名工程師撰寫的軟體。其用意正是從中取得標準化考試分數所無法衡量的資訊。
然而,這並不是一般使用者可以使用的產品。開發者所用的公開 API 目前仍運行著以「v8-small」為底座的 Grok 4.3,而這正是馬斯克本人此前評為「存在諸多根本性缺陷」的模型。放在 SpaceX 現場的模型,與透過 API 可用的模型,兩者的差距在參數量上約為 1 兆。
每月推出全新基礎模型的計畫
本次發表中不容忽視的,或許不是測試本身,而是其中埋藏的計畫。xAI 表示,將在 2026 年底前每月推出「從零重新訓練」的全新基礎模型,而非現有模型的升級版。
軟體每月更新並不稀奇,但基礎模型的每月更新則是另一回事。訓練一款基礎模型需耗費數億美元級別的費用,並需依序歷經預訓練、監督式微調、強化學習等工序。若真要每月運轉一次,這將成為一項關於 Colossus 運算能力的、前所未有的主張。
對開發者而言,這還會帶來與效能無關的另一重煩惱。若在評測並將某款模型整合進產品之後,每隔 30 天就出現一款新模型,那麼遷移的成本與心力便不容忽視。快速的更新節奏,反而可能讓開發者的選型變得更加困難。
與收購 Cursor 的關係
xAI 的動作也與其對程式開發工具 Cursor 的收購交織在一起。這項與開發方 Anysphere 達成的交易,是一筆總額 600 億美元(約 9.7 兆日圓)的全股票交易,於 2026 年 6 月簽署,預計在第三季內完成。一旦實現,xAI 將取得 Cursor 的作業資料,以及超過 100 萬名開發者的使用基礎。
不過,眼下的制約在於時間。Cursor 此前一直維持著能同時處理 Anthropic 的 Claude、OpenAI 的 GPT 以及自家 Composer 等多款模型的「模型無關」姿態。在合併完成、V9 系模型進入公開 API 之前,這些選項預計將維持不變。
總結
Grok 4.5 是一款採用 xAI 迄今最大基礎模型 V9 的雄心之作,但其真實樣貌仍有諸多隱藏。它止步於 SpaceX 與特斯拉的非公開測試,未給出公開發布的時間,也未接受任何第三方基準測試。而且一般使用者真正能接觸到的公開 API,仍運行著開發方自己承認存在缺陷的舊款模型。「接近 Opus」的效能說法是否屬實,只能等待公開發布與獨立評測。倘若每月從零推出新模型的計畫得以實現,將改寫業界的速度感;但就目前而言,被宣稱的效能與手中可用的效能之間,仍橫亙著 1 兆參數的鴻溝。
