能在本機執行大型語言模型的 Ollama,在最新的 0.31 版本中大幅提升了 Google 開源模型 Gemma 4 的生成速度[1]。在搭載 Apple 晶片的 Mac 上,據稱在一項模擬程式開發工作的基準測試中,token 生成速度平均加快了約 90%[1]。此項加速在預設設定下即已啟用,而模型回傳的輸出內容本身並不改變。支撐這項加速的,是一種稱為「多 token 預測(MTP)」的機制。
Gemma 4 在 Ollama 0.31 中大幅加速
本次改進的對象,是 Google 發布的輕量級開源模型 Gemma 4。在 Ollama 0.31 及之後的版本中,這款模型的推論已針對 Apple 晶片進行最佳化,官方實測 token 生成速度平均提升約 90%[1]。
關鍵在於,速度提升的同時,輸出內容並不會改變。這純粹是為了「以更快的速度回傳相同答案」而做的改進,並未犧牲準確度或回應品質。也無需變更任何設定,只要安裝受支援的版本,就能自動獲得加速帶來的好處[1]。
支撐加速的「多 token 預測(MTP)」
速度提升的核心是多 token 預測(Multi-Token Prediction,以下簡稱 MTP)。Gemma 4 隨附一個與主模型並行執行、體積小且速度快的「草稿模型(起草者)」,由它一次預測接下來的多個 token[1]。主模型接著在一次處理中一併驗證這些預測方案,只保留判斷為正確的 token。由於草稿模型遠比主模型小,其預測成本很低,一旦命中,就能以處理一個 token 的代價一次確定多個 token[1]。
據稱,這種方式與產生程式碼特別契合。程式碼中有大量的收合括號、反覆出現的識別字以及樣板式的寫法,使得後續內容更容易被預測[1]。程式開發代理程式在讀取檔案、執行工具的過程中會不斷呼叫模型。每一次生成變快後,這類代理程式的回應在體感上也更為流暢。
順帶一提,透過預測並驗證多個 token 來達成加速的方法稱為「推測式解碼」,Google 本身也介紹過為 Gemma 4 採用草稿模型實現的類似加速[2]。
三項技術上的巧思
Ollama 表示,為了榨出這樣的速度,結合了三個要素[1]。
第一是起草 token 數量的自動調整。一次預測的最佳 token 數,會隨模型、量化方式、硬體以及生成過程中文字的可預測程度而變化。預測太少會留下效能餘裕,預測太多則會把時間耗在驗證被拒絕的方案上,反而更慢。Ollama 在執行時追蹤預測的採納率與每次驗證所花的時間,隨時選擇每秒生成 token 數最高的長度。當預測不再被採納時,它會自動退回逐一 token 生成的方式[1]。
第二是處理流程的改進。從草稿模型的預測,到主模型的批次驗證,這一整套流程都在 GPU 上一併執行。被拒絕的 token 在處理途中已寫入快取,但只需回退到事先記錄的「回溯點」即可,因此撤銷的成本很低[1]。
第三是 GPU 運算本身的效率提升。負荷最集中的是驗證而非起草這個環節。驗證需要處理 2 到 8 個 token 這種略顯尷尬的批次大小,而傳統運算方式要麼針對「單一 token」、要麼針對「大批次 token」進行最佳化,恰恰不擅長處理這個中間地帶。Ollama 為此情境向 Apple 的機器學習框架「MLX」貢獻了相應的處理。它只需讀取一次權重資料便可在整個批次中重複使用,在 M5 Max 與 nvfp4 的組合下,Gemma 4 最大的矩陣運算加速了 2 至 2.5 倍[1]。
如何開始使用
使用需要 macOS 版的 Ollama 0.31 或更新版本。安裝完成後,可用以下指令啟動由 Gemma 4 驅動的程式開發代理程式。
ollama launch claude --model gemma4:12b-mlx
若先前已取得過 Gemma 4,請重新拉取模型以取得支援 MTP 的版本。
ollama pull gemma4:12b-mlx
這個啟動方式同樣適用於 Codex、Droid、OpenCode、Copilot 等其他程式開發輔助工具[1]。根據 Ollama 表示,Gemma 4 是首個獲得此項加速的模型,後續還會有更多模型跟進[1]。
總結
Ollama 0.31 將多 token 預測與針對 MLX 的運算最佳化相結合,在 Apple 晶片上把 Gemma 4 的生成速度平均提升了約 90%。它在不改變輸出的前提下變快,無需任何設定,尤其在程式開發代理程式這類連續呼叫的情境中效果更為明顯。在本機執行模型這件事上,其易用性又朝實用邁進了一步。
出典:https://ollama.com/blog/faster-gemma-4-mlx-mtp
出典:https://blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/
