SpaceXAI 預計在 9 月中旬推出新一代旗艦模型 Grok 4.7。伊隆·馬斯克 9 月 2 日在 X 上表示,距離發布大約還有 10 天。公布的規模約為 2.1 兆參數,比現行的 Grok 4.6 多出約 4 成,訓練過程據稱也用上了火箭與衛星的工程資料。不過開發者文件至今仍未出現它的模型 ID,也沒有價格。
只被形容為「大約 10 天後」的發布時機
發布時機的全部依據,就是馬斯克在 X 上寫下的那句「大約 10 天後」。從 9 月 2 日往後推算,落點大約在 9 月 11 日或 12 日。之後並沒有標明日期的新聞稿,這則貼文仍是唯一明確的訊號。
與前一代之間的間隔並不長。Grok 4.5 在 7 月推出,Grok 4.6 在 8 月 12 日推出,下一代約在一個月後到來。隨著長時間運行的代理程式應用競爭轉趨激烈,更新節奏明顯縮短。
另一方面,開發者文件的最後更新停在 8 月 21 日,模型清單中最新的仍是 grok-4.6。grok-4.7 的模型 ID、價格、脈絡長度與基準測試卡片都尚未公開。對準備進行整合的人來說,目前還沒有任何可用的資訊。
該如何看待 2.1 兆參數這個數字
規模是容易引用、卻不容易解讀的數字。依馬斯克的說法,Grok 4.6 約為 1.5 兆參數,Grok 4.7 約為 2.1 兆參數,差距約 4 成。
但光看這個數字,無法得知實際運作的參數有多少。在混合專家(MoE)這類架構中,總參數量與每個 token 實際動用的參數量是兩回事。啟用參數、稀疏度、專家路由方式以及推論成本,目前都沒有揭露。
參數量也不會線性決定效能。架構設計、訓練資料品質、後訓練的打磨、推論階段的效率最佳化都會發揮作用。規模增加 4 成,並不代表使用感受會提升 4 成。
押注 SpaceX 工程資料
另一個重點是訓練資料。據說在補充訓練階段導入了 SpaceX 的工程紀錄、遙測資料、內部文件以及 Starlink 衛星資料。
這一點與該公司的定位相連。開發 Grok 的是 SpaceXAI LLC,其品牌準則明確載明它與 X(原 Twitter)是不同的公司。能把火箭與衛星營運累積的實機資料投入語言模型訓練的企業並不多。
期待中的效果是,模型在處理現實工程問題時,能展現出與以文字為主訓練的模型不同的能力。不過這個前提尚未經過大規模的獨立驗證。加入設計資料就能把設計做得更好,聽起來直覺,但直覺與實證是兩回事。
馬斯克本人表示,Grok 4.7 在各方面都勝過 Grok 4.6,token 效率也有改善,同時也提到規模變大之後推論速度可能略微下降。
作為對照的 Grok 4.6 現況
新模型登場後的對照基準,是 8 月 12 日發布的 Grok 4.6。它的脈絡長度為 50 萬 token,API 價格為每百萬輸入 token 2 美元(約 310 日圓)、每百萬輸出 token 6 美元(約 940 日圓),高速版本則是兩倍。知識截止時間為 2026 年 2 月 1 日。
※1 美元 = 156 日圓(截至 2026 年 9 月 5 日)
在官方公布的評測中,Grok 4.6 於由 9 項基準合成的 Artificial Analysis Intelligence Index 取得 61 分,與 GPT-5.6 Sol Max 並列,Fable 5 Max 為 62 分。分項來看,GDPVal-AA v2 為 1753,CursorBench v3.2 為 69.9%,DeepSWE v1.1 為 65.9%,Terminal-Bench v3.0 為 26%,其中部分項目其他廠商的模型明顯領先。這一代主打長時間運行的代理程式工作,可透過 Cursor、Grok Build、API、OpenRouter、Vercel 與 Cloudflare 使用。
如果 Grok 4.7 真的「在各方面都勝過」,這些數字的變化就是判斷依據。
數字齊備之前需要保留判斷
過去的經驗同樣值得參考。Grok 4.6 發布時,就有人指出完整的基準測試結果沒有立刻公開。若 Grok 4.7 以同樣的方式登場,「超越所有模型」這類說法在一段時間內仍應視為行銷語言。
考慮導入的一方要看的數字很清楚:啟用參數量、脈絡長度、輸入與輸出價格,以及第三方能夠重現的基準測試。這 4 項補齊之後,替換既有工作流程才談得上是一個判斷。
總結
Grok 4.7 預計在 9 月中旬推出,規模約 2.1 兆參數,比 Grok 4.6 多出約 4 成。把 SpaceX 的工程資料用於補充訓練是它被強調的特點,但啟用參數、價格、脈絡長度以及經第三方驗證的基準測試都尚未公開。開發者文件中最新的仍是 grok-4.6,目前確定的只有大致的發布時機與關於規模的說法。等數字出來再做評價比較穩妥。
