ローカルで大規模言語モデル(LLM)を動かすツール「Ollama」が、Apple の機械学習フレームワーク「MLX」を使った高速化にプレビュー対応しました[1]。Apple Silicon 搭載の Mac で、これまでよりも速くモデルを動かせるようになる仕組みです[1]。とくに最新の M5・M5 Pro・M5 Max では、新しい GPU の処理を活用して応答の速さを引き上げたとされています[1]。クラウドに頼らず手元の Mac で AI を動かしたい人にとって、待望のアップデートと言えそうです。
Apple の「MLX」を土台に高速化
今回のプレビューは、Ollama を Apple Silicon 上で動かす最も速い方法と位置づけられています[1]。その土台になっているのが、Apple が手がける機械学習フレームワーク MLX です[1]。Ollama はこの MLX の上で動くようになり、Apple Silicon が持つユニファイドメモリ(CPU と GPU が同じメモリ領域を共有する設計)を生かせるようになりました[1]。
この変更によって、すべての Apple Silicon 搭載機で大きな速度向上が見込めるとされています[1]。具体的な恩恵としては、OpenClaw のような個人向けアシスタントや、Claude Code・OpenCode・Codex といったコーディング支援ツール(コーディングエージェント)の動作が速くなる点が挙げられています[1]。
M5 世代の新 GPU で応答が速く
最新の M5・M5 Pro・M5 Max チップでは、新たに搭載された GPU Neural Accelerator(GPU 内でAI処理を加速する仕組み)を活用します[1]。これにより、最初の応答が返るまでの時間(TTFT、Time To First Token)と、文章を生成する速度(1秒あたりのトークン数)の両方が速くなったと説明されています[1]。
性能の比較は2026年3月29日に行われ、Alibaba のモデル Qwen3.5-35B-A3B を NVFP4 という形式に量子化(モデルを軽量化する処理)したものと、従来の Q4_K_M 形式とを、Ollama 0.18 を使って測定したとしています[1]。さらに次期版の Ollama 0.19 では性能がより高まる見込みで、int4 量子化での実行時にプリフィル(入力の処理)で毎秒1851トークン、デコード(文章の生成)で毎秒134トークンに達するとされています[1]。
NVFP4対応とキャッシュの改良
今回の対応では、NVIDIA が定める NVFP4 形式にも対応しました[1]。これは、モデルの精度を保ちながら、推論に必要なメモリ帯域と保存容量を抑えられる形式です[1]。多くの推論サービスが NVFP4 での運用を広げているため、Ollama の利用者も本番環境と同じ結果を得やすくなり、NVIDIA のモデル最適化ツールで調整されたモデルを動かす道も開けるとしています[1]。
あわせて、キャッシュ(計算結果の一時保存)の仕組みも改良されました[1]。会話をまたいでキャッシュを再利用することでメモリ消費を抑え、Claude Code のように共通の指示文(システムプロンプト)を使うツールでキャッシュのヒット率を高めます[1]。さらに、処理の要所でキャッシュの状態を保存するインテリジェントチェックポイントにより、入力の再処理を減らして応答を速め、共有している部分がより長く保持されるようにする工夫も加えられています[1]。
試し方と必要な環境
このプレビュー版では、コーディング向けに調整された Qwen3.5-35B-A3B モデルを高速に動かせます[1]。利用には、ユニファイドメモリが32GBを超える Mac が必要とされています[1]。
Claude Code と組み合わせて使う場合は、次のコマンドを実行します[1]。
ollama launch claude --model qwen3.5:35b-a3b-coding-nvfp4
OpenClaw の場合は次の通りです[1]。
ollama launch openclaw --model qwen3.5:35b-a3b-coding-nvfp4
モデルと直接対話したい場合は、次のコマンドを使います[1]。
ollama run qwen3.5:35b-a3b-coding-nvfp4
Ollama は今後、さらに多くのモデルへの対応を進めるとしており、対応するアーキテクチャを順次拡大するほか、独自に微調整(ファインチューニング)したモデルを取り込みやすくする方法も用意する予定です[1]。
まとめ
Ollama が Apple Silicon で MLX に対応し、ユニファイドメモリを生かしてローカルAIをより速く動かせるようになりました。とくに M5・M5 Pro・M5 Max では新しい GPU Neural Accelerator を活用し、最初の応答までの時間と生成速度の両方が向上しています。NVFP4 への対応やキャッシュの改良も加わり、Claude Code や OpenClaw といったツールの動作が速くなる見込みです。現時点ではプレビューで32GBを超えるユニファイドメモリを備えた Mac が必要ですが、手元の Mac 1台で完結する AI 活用の幅をさらに広げる一歩になりそうです。