ローカルAI実行環境のOllamaは2026年6月11日、Apple Silicon向けMLXエンジンの大型アップデートを発表しました。NVIDIAのモデル最適化フォーマット「NVFP4」への対応、Metalカーネルの最適化による最大20パーセントの高速化、そしてエージェント処理を効率化する新しいスナップショット機構が柱です。AppleのユニファイドメモリとMetalベースのMLXフレームワークをより深く活用することで、Mac上のローカルAIが「過去最高の性能」に到達したとしています[1]。
NVFP4対応で4bit量子化の品質低下をほぼ半減
今回のアップデートの目玉の1つが、NVIDIAのモデル最適化フォーマット「NVFP4」への対応です。NVFP4はモデル重みの局所的なダイナミックレンジをより細かく追跡する設計の4bit量子化フォーマットで、量子化に伴う品質低下を抑えられるのが特徴です[1]。
Ollamaが Gemma 4 12B モデルで、一般的な4bit量子化フォーマットの q4_K_M、NVFP4、無量子化の bf16 のパープレキシティ(言語モデルの予測精度を測る指標)を比較したところ、モデル最適化済みのNVFP4は性能を維持したまま品質低下をおよそ半分に抑えられたとのことです[1]。
もう1つ見逃せないのが、データセンター向けに最適化されたモデルをそのままOllamaのMLXエンジンに取り込んで実行できるようになった点です。NVFP4はもともとデータセンターでの推論向けに使われてきたフォーマットなので、サーバー用とデスクトップ用でモデルを作り分けることなく、同じモデルを両方の環境で持ち運べるようになります[1]。
Metalカーネルの融合などで出力速度は最大20パーセント向上
出力性能も強化されました。MLXのJIT(実行時)コンパイラ機能を使って複数の処理を単一のMetalカーネルに融合したほか、GPUベースのサンプリング処理も作り直され、MLXエンジンは従来比で最大20パーセント高速になっています[1]。Ollamaは2026年3月にApple Silicon向けのMLX対応をプレビューとして公開したばかりですが[2]、わずか数か月で着実に性能を積み増してきている形ですね。
エージェント時代の課題に応える新スナップショット機構
今回のアップデートで特に興味深いのが、エージェント用途を見据えたスナップショット機構です。コーディングエージェントのようなワークロードでは、ツール呼び出しのたびにシステムプロンプト・ツール定義・読み込んだファイルを含む会話全体を送り直すため、同じコンテキストを何十回も処理し直すことになります。従来はプレフィックスキャッシュ(直前の続きから再開する仕組み)で重複処理を避けていましたが、これは各リクエストが前回の続きである場合にしか機能しません[1]。
実際のエージェントセッションはそう単純には進みません。そこで新しいスナップショット機構は、会話が戻ってきやすい要所要所でモデルの状態を保存します。これはOllamaのクラウドでエージェントワークロードを処理しているのと同じ手法とのことです。具体的には次のような場面で効果を発揮します[1]。
サブエージェントへの引き継ぎや複数セッションの並行実行では、それぞれが自分の保存済み状態から再開でき、共通部分(数万トークンに及ぶこともあるシステムプロンプトやツール定義など)は1回だけ処理すれば済みます。推論(リーズニング)モデルでは、思考トークンが会話履歴から破棄されるため通常は毎ターン会話全体を再処理することになりますが、応答開始直前のスナップショットがあれば次のターンはそこから再開できます。回答の再生成や別の追加質問で会話が分岐する場合も、分岐点にスナップショットがあるため新しい方向の処理だけで済みます[1]。
最近のモデルで主流のスライディングウィンドウ注意機構や再帰層は、一度通り過ぎた地点の状態を巻き戻せないため、こうした状態保存は見た目以上に難しい処理です。Ollamaはスナップショットを選択的かつ増分的に保持することで、モデル本体に使えるメモリを確保しているとしています[1]。
利用方法
MLXエンジンを使うには、最新版のOllamaをダウンロードしてモデルを実行するだけです[1]。
ollama run gemma4:12b-mlx
コーディングエージェントで使う場合は ollama launch コマンドを利用します[1]。
ollama launch pi --model gemma4:12b-mlx
まとめ
NVFP4対応による品質向上、最大20パーセントの高速化、そしてエージェント用途を支えるスナップショット機構と、ローカルAIの実用性を底上げする内容が詰まったアップデートです。データセンター向けモデルをそのままMacへ持ち込める移植性も、オープンモデル活用の幅を広げてくれそうです。筆者としては、ローカルでエージェントを回す際のレスポンス改善がどこまで体感できるか試してみたくなりますね。
出典[1]: https://ollama.com/blog/mlx-performance
出典[2]: https://ollama.com/blog/mlx
