Meta Superintelligence Labs 推出的全新開放模型 Muse Glimmer,現在已能透過 Ollama 使用[1]。這是一款參數規模 300 億的多模態模型,專為代理(agent)工作負載打造,首波支援是透過 Ollama 的 MLX 引擎在 Apple Silicon 上執行。換個說法,Claude Code、Codex 這類程式設計代理背後的大腦,如今可以放在自己的 Mac 上,不必再仰賴雲端。
首波支援從 Apple Silicon 的 MLX 引擎開始
依照 Ollama 在 8 月 10 日發布的公告,目前對 Muse Glimmer 的支援僅限於透過該公司 MLX 引擎在 Apple Silicon 上的初步對應[1]。針對 Apple Silicon 的後續支援與最佳化,以及 NVIDIA、AMD 等其他平台的對應,預計會在數日內陸續推出。
實際上手的步驟短得讓人有些意外。安裝最新版的 Ollama 之後,只要執行一行指令即可。
ollama run muse-glimmer:30b-mlx
Muse Glimmer 也支援可調整的推理強度,共有 low、medium、high、xhigh 4 個等級[1]。Ollama 建議在複雜的程式設計與代理工作上使用 high 或 xhigh,需要速度時則改用較低的等級。本機執行的運算資源有限,這樣的調整空間直接影響實用性。
把 Claude Code 與 Codex 的大腦換成本機模型
這次對應最值得注意的地方,在於既有的代理工具幾乎不必改動就能沿用。Ollama 提供的在 Muse Glimmer 上執行 Claude Code 的指令如下[1]。
ollama launch claude --model muse-glimmer:30b-mlx
較為輕量的程式設計代理 Pi,以及 OpenClaw、Hermes 這類常駐型個人助理框架,用法完全相同。
ollama launch pi --model muse-glimmer:30b-mlx
ollama launch openclaw --model muse-glimmer:30b-mlx
ollama launch hermes --model muse-glimmer:30b-mlx
這個 launch 指令同樣適用於 Codex、OpenCode、GitHub Copilot 等工具[1]。代理的外殼維持原樣,只把底層模型換成本機執行,對已經習慣某套工作流程的開發者來說,移轉門檻低了不少。
DFlash 帶來 1.5 至 1.8 倍加速,18 億參數感知編碼器能讀圖
Ollama 的 MLX 引擎在原有的多權杖預測(MTP)支援之上,新增了對 DFlash 的支援。藉此,Muse Glimmer 在 Apple Silicon 上的執行速度提升為 1.5 倍至 1.8 倍[1]。
DFlash 屬於推測式解碼的一種。Meta 的說明指出,Muse Glimmer 內附一個輕量的草稿模型,會一次提出整段權杖,再由主模型平行驗證,接受正確的部分並修正錯誤的部分[2]。相較於逐個權杖生成的一般方式速度更快,輸出品質則維持一致。Meta 自行實測的結果顯示,RTX 5090 上加速 3.1 倍、M5 Max 上 1.8 倍、M4 Max 上 1.5 倍[2]。
另一項重點能力是影像輸入。Muse Glimmer 配備 18 億參數的專用感知編碼器,具備原生的影像理解能力[1]。隨著 MLX 引擎支援影像輸入,程式設計代理在牽涉影像的工作上也能低延遲地連續呼叫工具。Ollama 舉出的用途包括:依照手繪草圖或設計稿建構網站與應用程式、以螢幕截圖驅動的電腦操作,以及讀取檔案、收據與圖表[1]。
300 億參數為何裝得進消費級硬體
Meta 表示,Muse Glimmer 以 Apache 2.0 授權公開權重,針對常駐執行的本機代理工作流程進行最佳化[2]。預訓練階段使用更大的教師模型 Muse Spark 的輸出進行 logit 蒸餾,接著在長上下文、代理密集的資料上完成中期訓練,最後透過監督式微調結合線上策略蒸餾與強化學習完成後訓練。
體積問題則以量化解決。300 億參數的模型若以完整精度執行,需要超過 55GB 記憶體,任何消費級 GPU 都放不下[2]。將權重壓縮到約 4 位元精度後,語言模型部分縮減到 20GB 以內,於是在 24GB 或 32GB 的範圍內仍能同時容納 KV 快取、負責影像理解的感知編碼器,以及推測式解碼用的草稿模型。Meta 說明,這樣的壓縮對代理任務的效能影響極小甚至沒有。
效能方面,Meta 表示 Muse Glimmer 在多項廣泛使用的基準測試中,相對於同尺寸級距的 Gemma4-31B 與 Qwen3.6-27B 表現亮眼[2]。模型權重在 Hugging Face 上發布[3],除了 Ollama 之外,也可透過 LM Studio、Unsloth、llama.cpp、ExecuTorch、vLLM、SGLang 等途徑執行[2]。
總結
Ollama 對 Muse Glimmer 的支援,目前仍是侷限於 Apple Silicon MLX 引擎的初步對應。不過這套組合的份量不小:一個透過 4 位元量化壓到 20GB 以內的 300 億參數多模態模型,搭配 DFlash 加速與影像輸入能力,能在自己的 Mac 上跑起來,還能直接替換掉 Claude Code 或 Codex 背後的雲端模型。本機代理的實用水準因此明顯往上抬了一階。考量到 NVIDIA 與 AMD 的支援預計在數日內跟進,不必連網也能運作的代理環境,涵蓋範圍應該還會繼續擴大。
來源[1]:https://ollama.com/blog/muse-glimmer
來源[2]:https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model
