本地 AI 執行環境 Ollama 於 2026 年 6 月 11 日宣布,針對 Apple Silicon 的 MLX 引擎推出大型更新。本次更新有三大重點:支援 NVIDIA 的模型最佳化格式 NVFP4、透過 Metal 核心最佳化讓輸出速度提升最多 20%,以及能有效處理智慧代理(Agent)工作負載的全新快照機制。Ollama 表示,藉由更深入運用 Apple 的統一記憶體與基於 Metal 的 MLX 框架,Mac 上的本地 AI 已達到歷來最高效能[1]。
支援 NVFP4 讓 4bit 量化的品質損失幾乎減半
本次更新的一大亮點,是支援 NVIDIA 的模型最佳化格式 NVFP4。NVFP4 是一種 4bit 量化格式,設計上能更精細地追蹤模型權重的局部動態範圍,將量化造成的品質下降壓到更低[1]。
Ollama 以 Gemma 4 12B 模型比較了常見 4bit 量化格式 q4_K_M、NVFP4 與未量化的 bf16 的困惑度(衡量語言模型預測精準度的指標),結果顯示經過模型最佳化的 NVFP4 在維持效能的同時,將品質損失大約減少了一半[1]。
另一個值得留意的重點,是針對資料中心部署最佳化的模型,現在可以直接匯入 Ollama 的 MLX 引擎執行。由於 NVFP4 原本主要用於資料中心的推論場景,今後不必為伺服器與桌面分別準備模型,同一個模型即可在兩種環境之間自由移轉[1]。
融合 Metal 核心等最佳化讓輸出速度提升最多 20%
輸出效能也同步強化。利用 MLX 的 JIT(即時)編譯器功能,多個運算被融合為單一 Metal 核心,GPU 取樣處理也經過重寫,MLX 引擎的速度比以往提升最多 20%[1]。Ollama 在 2026 年 3 月才以預覽形式推出 Apple Silicon 的 MLX 支援[2],短短數個月便穩定累積出可觀的效能進步。
回應智慧代理時代課題的全新快照機制
本次更新中特別有意思的,是著眼於智慧代理應用所設計的快照機制。在程式編寫代理這類工作負載中,每次工具呼叫都會重新傳送包含系統提示詞、工具定義與已讀取檔案在內的完整對話內容,導致相同的脈絡被反覆處理數十次。過去仰賴前綴快取(從上一次進度接續處理的機制)來避免重複運算,但它只有在每個請求都緊接著上一個請求時才能發揮作用[1]。
實際的智慧代理工作階段並不會一直這麼單純。新的快照機制會在對話容易返回的關鍵節點保存模型狀態,據稱這與 Ollama 雲端處理智慧代理工作負載所採用的方法相同。具體而言,在以下情境中能發揮效果[1]。
當代理將任務交棒給子代理,或多個工作階段並行執行時,各自都能從自己保存的狀態恢復,彼此共通的部分(例如可能多達數萬 token 的系統提示詞與工具定義)只需處理一次。對於推理(Reasoning)模型,思考 token 會從對話歷史中被捨棄,通常每一輪都得重新處理整段對話,但只要在回應開始前保存快照,下一輪就能從該處接續。在重新生成回答或提出其他追加問題使對話分岔時,由於分岔點已有快照,只需處理新方向的內容即可[1]。
近來主流模型採用的滑動視窗注意力機制與循環層,一旦越過對話中的某個節點便無法倒回狀態,因此這類狀態保存比表面上看起來更困難。Ollama 表示,透過有選擇且增量式地保留快照,為模型本體保留了更多記憶體[1]。
使用方式
要使用 MLX 引擎,只需下載最新版 Ollama 並執行模型[1]。
ollama run gemma4:12b-mlx
在程式編寫代理中使用時,可執行 ollama launch 指令[1]。
ollama launch pi --model gemma4:12b-mlx
總結
支援 NVFP4 帶來的品質提升、最多 20% 的提速,以及支撐智慧代理應用的快照機制,這次更新匯集了全面提高本地 AI 實用性的內容。能將資料中心最佳化模型直接帶到 Mac 上的可攜性,也有望拓展開源模型的運用空間。筆者很想實際試試在本地執行智慧代理時,回應速度的改善究竟有多有感。
