Meta Superintelligence Labs 发布的新开源模型 Muse Glimmer 现已可通过 Ollama 使用[1]。这是一款参数规模为 300 亿的多模态模型,专为智能体(agent)任务打造,首批支持通过 Ollama 的 MLX 引擎在 Apple Silicon 上运行。换句话说,Claude Code、Codex 这类编程智能体背后的大脑,如今可以放在自己的 Mac 上,而不必依赖云端。

首批支持从 Apple Silicon 的 MLX 引擎开始

根据 Ollama 在 8 月 10 日发布的公告,目前对 Muse Glimmer 的支持仅限于借助该公司 MLX 引擎在 Apple Silicon 上的初步适配[1]。针对 Apple Silicon 的进一步支持与优化,以及对 NVIDIA、AMD 等其他平台的适配,将在未来数日内陆续推出。

上手过程短得有些出人意料。安装最新版 Ollama 之后,只需执行一条命令。

ollama run muse-glimmer:30b-mlx

Muse Glimmer 还支持可调节的推理强度,共有 low、medium、high、xhigh 4 个档位[1]。Ollama 建议在复杂编程与智能体任务中使用 high 或 xhigh,而在更看重速度的场景下选择较低档位。本地运行的算力有限,这样的调节余地直接关系到实际可用性。

把 Claude Code 与 Codex 的大脑换成本地模型

这次适配最值得关注的一点,是现有智能体工具几乎无需改动即可沿用。Ollama 给出的在 Muse Glimmer 上运行 Claude Code 的命令如下[1]。

ollama launch claude --model muse-glimmer:30b-mlx

更轻量的编程智能体 Pi,以及 OpenClaw、Hermes 这类常驻型个人助理框架,用法完全相同。

ollama launch pi --model muse-glimmer:30b-mlx
ollama launch openclaw --model muse-glimmer:30b-mlx
ollama launch hermes --model muse-glimmer:30b-mlx

该 launch 命令同样适用于 Codex、OpenCode、GitHub Copilot 等工具[1]。智能体的外壳保持不变,只把底层模型换到本地,这让已经用惯某套工作流的开发者迁移成本大幅降低。

DFlash 带来 1.5 至 1.8 倍提速,18 亿参数感知编码器可读图

Ollama 的 MLX 引擎在此前多令牌预测(MTP)支持的基础上新增了对 DFlash 的支持。借此,Muse Glimmer 在 Apple Silicon 上的运行速度提升到 1.5 倍至 1.8 倍[1]。

DFlash 属于投机解码的一种。Meta 的说明称,Muse Glimmer 随附一个轻量的草稿模型,它会一次性提出整段令牌,再由主模型并行验证,接受正确的部分并修正错误的部分[2]。相比逐个令牌生成的常规方式速度更快,而输出质量保持一致。Meta 自己的实测显示,RTX 5090 上提速 3.1 倍,M5 Max 上 1.8 倍,M4 Max 上 1.5 倍[2]。

另一项重要能力是图像输入。Muse Glimmer 配备了 18 亿参数的专用感知编码器,具备原生的图像理解能力[1]。随着 MLX 引擎支持图像输入,编程智能体在涉及图像的任务中也能实现低延迟的连续工具调用。Ollama 列举的场景包括:根据手绘草图或原型稿搭建网站与应用、以截图驱动的计算机操作,以及读取文档、票据和图表[1]。

300 亿参数为何能装进消费级硬件

Meta 表示,Muse Glimmer 以 Apache 2.0 许可证公开权重,针对常驻运行的本地智能体工作流做了优化[2]。预训练阶段使用更大的教师模型 Muse Spark 的输出进行 logit 蒸馏,随后在长上下文、智能体密集型数据上完成中期训练,最后通过监督微调结合在线策略蒸馏与强化学习完成后训练。

体积问题靠量化解决。300 亿参数的模型若以全精度运行,需要超过 55GB 内存,任何消费级 GPU 都装不下[2]。将权重压缩到约 4 比特精度后,语言模型部分缩减至 20GB 以内,从而在 24GB 或 32GB 的内存范围内还能同时容纳 KV 缓存、用于图像理解的感知编码器以及投机解码的草稿模型。Meta 称这种压缩对智能体任务的性能影响极小甚至没有。

性能方面,Meta 表示 Muse Glimmer 在多项广泛使用的基准测试中,相对同尺寸级别的 Gemma4-31B 与 Qwen3.6-27B 表现出色[2]。模型权重在 Hugging Face 上发布[3],除 Ollama 之外,还可通过 LM Studio、Unsloth、llama.cpp、ExecuTorch、vLLM、SGLang 等途径运行[2]。

总结

Ollama 对 Muse Glimmer 的支持目前仍是限于 Apple Silicon MLX 引擎的初步适配。但这套组合的意义并不小:一个通过 4 比特量化压缩到 20GB 以内的 300 亿参数多模态模型,配合 DFlash 提速与图像输入能力,能在自己的 Mac 上运行,还能直接替换 Claude Code 或 Codex 背后的云端模型。这明显抬高了本地智能体的实用门槛线。考虑到对 NVIDIA 与 AMD 的支持预计在数日内跟进,无需联网也能使用的智能体环境,覆盖面还会继续扩大。

来源[1]:https://ollama.com/blog/muse-glimmer

来源[2]:https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model

来源[3]:https://huggingface.co/meta-models/Muse-Glimmer-30B