用於在本地執行大型語言模型(LLM)的工具「Ollama」現已預覽支援透過蘋果的機器學習框架「MLX」進行加速[1]。此機制可讓搭載 Apple Silicon 的 Mac 比以往更快地執行模型[1]。尤其在最新的 M5、M5 Pro、M5 Max 上,Ollama 運用全新的 GPU 處理能力提升了回應速度[1]。對於希望不依賴雲端、在自己的 Mac 上執行 AI 的使用者而言,這是一次值得期待的更新。

以蘋果的「MLX」為基礎實現加速

此次預覽被定位為在 Apple Silicon 上執行 Ollama 的最快方式[1]。其基礎正是蘋果打造的機器學習框架 MLX[1]。Ollama 現已執行於 MLX 之上,因而能充分運用 Apple Silicon 所具備的統一記憶體(CPU 與 GPU 共用同一記憶體空間的設計)[1]。

藉由這項變更,所有搭載 Apple Silicon 的裝置都有望獲得大幅加速[1]。具體的好處包括:OpenClaw 這類面向個人的助理,以及 Claude Code、OpenCode、Codex 等程式輔助工具(程式代理)的執行速度都會更快[1]。

M5 世代的全新 GPU 讓回應更快

在最新的 M5、M5 Pro、M5 Max 晶片上,Ollama 會運用新增的 GPU Neural Accelerator(在 GPU 內部加速 AI 處理的機制)[1]。據說明,這使得首個回應返回所需的時間(TTFT,Time To First Token)與生成文字的速度(每秒 token 數)皆獲得提升[1]。

效能比較於 2026 年 3 月 29 日進行,測試將阿里巴巴的 Qwen3.5-35B-A3B 模型量化為 NVFP4 格式(一種為模型瘦身的處理)後,與傳統的 Q4_K_M 格式在 Ollama 0.18 上進行比較[1]。此外,下一版本 Ollama 0.19 的效能有望再提升一步,在以 int4 量化執行時,預填(處理輸入)可達每秒 1851 個 token,解碼(生成文字)可達每秒 134 個 token[1]。

支援 NVFP4 與快取改良

此次支援也納入了 NVIDIA 所制定的 NVFP4 格式[1]。這是一種在維持模型精度的同時,能降低推論所需記憶體頻寬與儲存容量的格式[1]。由於眾多推論服務正擴大對 NVFP4 的採用,Ollama 使用者也更容易取得與正式環境一致的結果,並為執行經 NVIDIA 模型最佳化工具調校過的模型開啟了途徑[1]。

同時,快取(運算結果的暫存)機制也獲得改良[1]。透過在多次對話之間重複使用快取以降低記憶體用量,並為 Claude Code 這類使用共同指令文字(系統提示)的工具提高快取命中率[1]。此外,藉由在處理關鍵節點儲存快取狀態的智慧檢查點,可減少對輸入的重複處理、加快回應,並讓共用的部分得以保留更久[1]。

試用方式與所需環境

此預覽版可高速執行針對寫程式調校過的 Qwen3.5-35B-A3B 模型[1]。使用時需要一台統一記憶體超過 32GB 的 Mac[1]。

若要搭配 Claude Code 使用,請執行以下指令[1]。

ollama launch claude --model qwen3.5:35b-a3b-coding-nvfp4

OpenClaw 的指令如下[1]。

ollama launch openclaw --model qwen3.5:35b-a3b-coding-nvfp4

若想直接與模型對話,請使用以下指令[1]。

ollama run qwen3.5:35b-a3b-coding-nvfp4

Ollama 表示今後將持續推進對更多模型的支援,逐步擴大所支援的架構範圍,並提供更便利地匯入自行微調模型的方式[1]。

總結

Ollama 在 Apple Silicon 上支援了 MLX,藉由統一記憶體讓本地 AI 執行得更快。尤其在 M5、M5 Pro、M5 Max 上,它運用全新的 GPU Neural Accelerator,使首個回應所需時間與生成速度同時提升。再加上對 NVFP4 的支援與快取改良,Claude Code、OpenClaw 等工具有望執行得更快。目前它仍是需要超過 32GB 統一記憶體 Mac 的預覽版,但無疑為「僅憑一台 Mac 即可完成的 AI 應用」進一步拓寬了空間。

來源:https://ollama.com/blog/mlx