ローカルで大規模言語モデルを動かせるOllamaが、最新版の0.31でGoogleのオープンモデル「Gemma 4」の生成速度を大きく引き上げました[1]。Apple Silicon搭載Macでは、コーディング作業を模したベンチマークでトークン生成が平均およそ90パーセント速くなったとされます[1]。この高速化は初期設定で有効になっており、モデルが返す出力そのものは変わりません。速さを支えているのは「マルチトークン予測(MTP)」と呼ばれる仕組みです。
Gemma 4がOllama 0.31で大幅に高速化
今回の改善の対象は、Googleが公開する軽量なオープンモデル「Gemma 4」です。Ollama 0.31以降では、Apple Silicon向けにこのモデルの推論が最適化され、同社の計測でトークン生成が平均で約90パーセント高速化しました[1]。
重要なのは、速くなっても出力内容は変化しない点です。あくまで「同じ答えをより速く返す」ための改良であり、精度や応答の質を犠牲にしていません。設定を変更する必要もなく、対応バージョンを入れれば自動的に速度向上の恩恵を受けられます[1]。
高速化を支える「マルチトークン予測(MTP)」
速度向上の中心にあるのが、マルチトークン予測(Multi-Token Prediction、以下MTP)です。Gemma 4には、本体モデルと並走する小さく高速な「ドラフトモデル(下書き役)」が同梱されており、これが次に続く複数のトークンをまとめて予測します[1]。本体モデルはその予測案を1回の処理でまとめて検証し、正しいと判断したトークンだけを採用します。ドラフトモデルは本体よりはるかに小さいため予測のコストが低く、当たれば1トークン分の処理で複数トークンを一度に確定できるという理屈です[1]。
この方式は、コードの生成と特に相性が良いとされています。プログラムのコードは閉じ括弧や繰り返し現れる識別子、定型的な記述が多く、次に来る内容を予測しやすいためです[1]。ファイルを読み、ツールを実行しながら作業を進めるコーディングエージェントは、モデルを連続して呼び出します。1回ごとの生成が速くなることで、こうしたエージェントの応答が体感でも軽快になります。
なお、複数トークンを予測して検証する高速化の手法は「投機的デコーディング」として知られ、Google自身もGemma 4向けにドラフトモデルを用いた同様の高速化を紹介しています[2]。
3つの技術的な工夫
Ollamaは、速さを引き出すために3つの要素を組み合わせたと説明しています[1]。
1つ目は、下書きするトークン数の自動調整です。一度に予測すべき最適なトークン数は、モデルや量子化方式、ハードウェア、そして生成中のテキストの予測しやすさによって変わります。予測を少なくすると速度の伸びしろを残し、多くしすぎると却下される予測案の検証に時間を取られ、かえって遅くなります。Ollamaは実行中に予測の採用率と検証にかかる時間を追跡し、1秒あたりのトークン数が最大になる長さをその都度選びます。予測が当たらなくなれば、通常の1トークンずつの生成に自動で戻ります[1]。
2つ目は、処理の進め方の改良です。ドラフトモデルによる予測から、本体モデルによる一括検証までの一連の処理を、GPU上でまとめて実行します。却下されたトークンは処理途中でキャッシュに書き込まれていますが、あらかじめ記録しておいた「巻き戻し地点」まで戻すだけで済むため、やり直しのコストは小さく抑えられます[1]。
3つ目は、GPUでの計算そのものの効率化です。処理の負荷が集中するのは、下書きよりも検証の工程です。検証では2〜8トークン程度というやや中途半端な大きさのまとまりを扱う必要があり、従来の計算処理は「1トークン」か「大量のトークン」のどちらかに最適化されていて、この中間が苦手でした。Ollamaはこの用途に向けた処理をAppleの機械学習フレームワーク「MLX」に提供しています。重みデータを一度読み込めばまとめて再利用する仕組みで、M5 Maxとnvfp4の組み合わせでは、Gemma 4の最も大きな行列計算が2〜2.5倍速くなったとしています[1]。
使い始め方
利用にはmacOS向けのOllama 0.31以降が必要です。導入後、次のコマンドでGemma 4を使ったコーディングエージェントを起動できます。
ollama launch claude --model gemma4:12b-mlx
以前にGemma 4を入手済みの場合は、MTP対応版を取得するために再度モデルを取り込みます。
ollama pull gemma4:12b-mlx
この起動方法は、Codex、Droid、OpenCode、Copilotなど、ほかのコーディング支援ツールでも利用できます[1]。Ollamaによると、Gemma 4はこの高速化を最初に受けたモデルで、今後さらに対象を広げていく方針です[1]。
まとめ
Ollama 0.31は、マルチトークン予測とMLX向けの計算最適化を組み合わせ、Apple Silicon上でGemma 4の生成速度を平均約90パーセント引き上げました。出力を変えずに速くなり、設定も不要で、特にコーディングエージェントのような連続呼び出しで効果が出やすいのが特徴です。ローカルでモデルを動かす環境の使い勝手が、また一歩実用に近づいたと言えそうです。
出典:https://ollama.com/blog/faster-gemma-4-mlx-mtp
出典:https://blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/
