本地 AI 运行环境 Ollama 于 2026 年 6 月 11 日宣布对面向 Apple Silicon 的 MLX 引擎进行重大更新。本次更新的三大支柱是:支持 NVIDIA 的模型优化格式 NVFP4、通过 Metal 内核优化将输出速度提升最多 20%,以及高效处理智能体(Agent)工作负载的全新快照机制。Ollama 表示,通过更深入地利用 Apple 的统一内存和基于 Metal 的 MLX 框架,Mac 上的本地 AI 已达到有史以来的最高性能[1]。
支持 NVFP4 将 4bit 量化的质量损失几乎减半
本次更新的一大亮点是支持 NVIDIA 的模型优化格式 NVFP4。NVFP4 是一种 4bit 量化格式,其设计能够更精细地跟踪模型权重的局部动态范围,从而将量化带来的质量下降控制在较低水平[1]。
Ollama 在 Gemma 4 12B 模型上对比了常见 4bit 量化格式 q4_K_M、NVFP4 以及未量化的 bf16 的困惑度(衡量语言模型预测精度的指标),结果显示经过模型优化的 NVFP4 在保持性能的同时,将质量损失大约减少了一半[1]。
另一个值得关注的点是,针对数据中心部署优化的模型现在可以直接导入 Ollama 的 MLX 引擎运行。由于 NVFP4 原本主要用于数据中心的推理场景,今后无需为服务器和桌面分别制作模型,同一个模型即可在两种环境间自由迁移[1]。
融合 Metal 内核等优化使输出速度提升最多 20%
输出性能同样得到强化。借助 MLX 的 JIT(即时)编译器功能,多个运算被融合为单一 Metal 内核,GPU 采样处理也经过重写,MLX 引擎的速度比以往提升最多 20%[1]。Ollama 在 2026 年 3 月才以预览形式发布了面向 Apple Silicon 的 MLX 支持[2],短短几个月便稳步累积了可观的性能提升。
应对智能体时代课题的全新快照机制
本次更新中尤为有趣的是面向智能体场景设计的快照机制。在编程智能体之类的工作负载中,每次工具调用都会重新发送包含系统提示词、工具定义以及已读取文件在内的完整对话内容,导致相同上下文被反复处理数十次。以往依靠前缀缓存(从上一次的进度继续处理的机制)来避免重复计算,但它只有在每个请求都紧接上一个请求的情况下才能发挥作用[1]。
实际的智能体会话并不会一直这么简单。新的快照机制会在对话容易返回的关键节点保存模型状态,据称这与 Ollama 云端处理智能体工作负载所用的方法相同。具体而言,它在以下场景中能发挥作用[1]。
在向子智能体移交任务或多个会话并行运行时,各方都能从自己保存的状态恢复,而它们共有的部分(例如可能多达数万 token 的系统提示词和工具定义)只需处理一次。对于推理(Reasoning)模型,思考 token 会从对话历史中被丢弃,通常每一轮都不得不重新处理整个对话,但只要在回复开始前保存了快照,下一轮就能从该处继续。在重新生成回答或提出其他追加问题导致对话分叉时,由于分叉点已有快照,只需处理新方向的内容即可[1]。
近来主流模型采用的滑动窗口注意力机制和循环层,一旦越过对话中的某个节点便无法回溯状态,因此这种状态保存比表面看起来更难实现。Ollama 表示通过有选择地、增量式地保留快照,为模型本体留出了更多内存[1]。
使用方法
要使用 MLX 引擎,只需下载最新版 Ollama 并运行模型[1]。
ollama run gemma4:12b-mlx
在编程智能体中使用时,可执行 ollama launch 命令[1]。
ollama launch pi --model gemma4:12b-mlx
总结
支持 NVFP4 带来的质量提升、最多 20% 的提速,以及支撑智能体场景的快照机制,这次更新汇集了全面提高本地 AI 实用性的内容。能够将数据中心优化模型直接带到 Mac 上的可移植性,也有望拓宽开源模型的应用空间。笔者很想亲自试试在本地运行智能体时,响应速度的改善究竟有多明显。
