用于在本地运行大语言模型(LLM)的工具「Ollama」现已预览支持借助苹果的机器学习框架「MLX」进行加速[1]。这一机制可让搭载 Apple Silicon 的 Mac 比以往更快地运行模型[1]。尤其是在最新的 M5、M5 Pro、M5 Max 上,Ollama 利用全新的 GPU 处理能力提升了响应速度[1]。对于希望不依赖云端、在自己的 Mac 上运行 AI 的用户来说,这是一次值得期待的更新。

以苹果的「MLX」为基础实现加速

此次预览被定位为在 Apple Silicon 上运行 Ollama 的最快方式[1]。其基础正是苹果打造的机器学习框架 MLX[1]。Ollama 现已运行在 MLX 之上,从而能够充分利用 Apple Silicon 所具备的统一内存(CPU 与 GPU 共享同一内存空间的设计)[1]。

借助这一改动,所有搭载 Apple Silicon 的设备都有望获得大幅提速[1]。具体的好处包括:OpenClaw 等面向个人的助手,以及 Claude Code、OpenCode、Codex 等编程辅助工具(编程智能体)的运行速度都会更快[1]。

M5 世代的全新 GPU 让响应更快

在最新的 M5、M5 Pro、M5 Max 芯片上,Ollama 会利用新增的 GPU Neural Accelerator(在 GPU 内部加速 AI 处理的机制)[1]。据介绍,这使得首个响应返回所需的时间(TTFT,Time To First Token)与生成文本的速度(每秒 token 数)都得到了提升[1]。

性能对比于 2026 年 3 月 29 日进行,测试将阿里巴巴的 Qwen3.5-35B-A3B 模型量化为 NVFP4 格式(一种为模型瘦身的处理)后,与传统的 Q4_K_M 格式在 Ollama 0.18 上进行了比较[1]。此外,下一版本 Ollama 0.19 的性能有望进一步提升,在采用 int4 量化运行时,预填充(处理输入)可达每秒 1851 个 token,解码(生成文本)可达每秒 134 个 token[1]。

支持 NVFP4 与缓存改进

此次更新还支持了英伟达制定的 NVFP4 格式[1]。这是一种在保持模型精度的同时,能够降低推理所需内存带宽与存储容量的格式[1]。由于众多推理服务正在扩大对 NVFP4 的使用,Ollama 用户也更容易获得与生产环境一致的结果,并且为运行经英伟达模型优化工具调校过的模型打开了通路[1]。

与此同时,缓存(计算结果的临时存储)机制也得到了改进[1]。通过在多次会话之间复用缓存来降低内存占用,并为 Claude Code 这类使用共同指令文本(系统提示)的工具提高缓存命中率[1]。此外,借助在处理关键节点保存缓存状态的智能检查点,可减少对输入的重复处理、加快响应,并让共享的部分得以更长时间地保留[1]。

试用方法与所需环境

此预览版可高速运行针对编程调校过的 Qwen3.5-35B-A3B 模型[1]。使用时需要一台统一内存超过 32GB 的 Mac[1]。

若要与 Claude Code 搭配使用,请执行以下命令[1]。

ollama launch claude --model qwen3.5:35b-a3b-coding-nvfp4

OpenClaw 的命令如下[1]。

ollama launch openclaw --model qwen3.5:35b-a3b-coding-nvfp4

若想直接与模型对话,请使用以下命令[1]。

ollama run qwen3.5:35b-a3b-coding-nvfp4

Ollama 表示今后将继续推进对更多模型的支持,逐步扩大所支持的架构范围,并提供更便捷地导入自行微调模型的方式[1]。

总结

Ollama 在 Apple Silicon 上支持了 MLX,借助统一内存让本地 AI 运行得更快。尤其在 M5、M5 Pro、M5 Max 上,它利用全新的 GPU Neural Accelerator,使首个响应所需时间与生成速度同时提升。再加上对 NVFP4 的支持与缓存改进,Claude Code、OpenClaw 等工具有望运行得更快。目前它还是需要超过 32GB 统一内存 Mac 的预览版,但无疑为「仅凭一台 Mac 即可完成的 AI 应用」进一步拓宽了空间。

来源:https://ollama.com/blog/mlx