Google は 2026 年 5 月 5 日、オープンウェイト モデル「Gemma 4」ファミリー向けの Multi-Token Prediction (MTP) ドラフター を公開しました。同社はこの新しい投機的デコード用ドラフターを使うことで、出力品質や推論ロジックを劣化させずに最大 3 倍の高速化が見込めると説明しています。Apache 2.0 ライセンスでの提供であり、Hugging Face や Kaggle から本日すぐに入手できます[1]。Gemma 4 本体の公開時にコミュニティから「MTP ヘッドが Hugging Face 版に同梱されていない」と指摘されてきた論点を、Google 側が正面から塞ぐ動きでもあります[2]。
MTP ドラフターは何を解いているのか
標準的な大規模言語モデルの推論は、メモリ帯域に律速されることがボトルネックの一つになっています。Google は今回の発表で、プロセッサーの大半の時間が「数十億パラメータを VRAM から計算ユニットへ移すだけで終わってしまう」と説明し、消費者向けハードウェアほどこの遅延が顕在化しやすいと指摘しています[1]。投機的デコード(speculative decoding)はこの非効率を緩和する技術で、重いターゲット モデル(例えば Gemma 4 31B Dense)と軽量なドラフター(MTP モデル)を組み合わせ、ターゲット モデルが 1 トークン処理する時間でドラフターに複数のトークン候補を「先回り」させ、ターゲット モデルがそれらを並列検証します[1]。
技術自体は新しいものではありません。Google の Yaniv Leviathan 氏らが 2022 年に発表し ICML 2023 に採択された論文「Fast Inference from Transformers via Speculative Decoding」では、T5-XXL での標準実装に対して 2〜3 倍の高速化を、出力分布を変えずに実現できると報告されています[3]。今回の MTP ドラフターは、その系譜を Gemma 4 用にチューニングした実装と位置づけられます。
3 倍の根拠と前提条件
Google は LiteRT-LM、MLX、Hugging Face Transformers、vLLM の各環境で計測したと述べた上で、最大 3 倍の高速化を提示しています。発表ページには NVIDIA RTX PRO 6000 上で Gemma 4 26B を動かしたデモとして、「同じ出力品質で待ち時間が半分になる」比較動画も掲載されています[1]。
一方で、3 倍という数字はあくまで上限の指標です。Apple Silicon 上の 26B MoE モデルについては、バッチサイズ 1 では Mixture of Experts のルーティングが固有の課題を生むため、バッチを 4〜8 まで上げて初めて最大 2.2 倍程度のローカル高速化が得られると Google 自身が但し書きを添えています。NVIDIA A100 でも、バッチサイズを増やしたときに同様の改善が観測されたとされます[1]。
ベンチマークの幅は外部の検証でも示されています。コミュニティが Gemma 4 31B 向けに先行公開していた EAGLE3 ドラフター ヘッドでは、出力を変えないまま 1.72 倍の高速化が報告されており、ワークロードによっては MT-Bench のような会話系で速度が伸びる一方、SWEBench のようなコード重視タスクではトークンの予測精度が下がる傾向が観察されています[4]。
公開とアーキテクチャの工夫
MTP ドラフターは、Gemma 4 と同じ Apache 2.0 ライセンスで提供されます。重みは Hugging Face と Kaggle で配布されており、Hugging Face Transformers、MLX、vLLM、SGLang、Ollama での利用が想定されています。Android と iOS 向けには「Google AI Edge Gallery」上で直接試すこともできます[1]。
アーキテクチャの面では、ドラフター モデルがターゲット モデルの活性化(activations)と KV キャッシュを共有することで、文脈の再計算コストを省く設計になっています。エッジ向けの E2B / E4B モデルでは、ロジット計算がボトルネックになりやすいため、エンベッダー部分にクラスタリング ベースの効率化を導入したと説明されています[1]。
なお、4 月の Gemma 4 公開時点では、訓練に使われた MTP ヘッドが Hugging Face 版から取り除かれており、当初は Google 自身の LiteRT 用エクスポートでのみ利用可能と紹介されていました。コミュニティ側はこの空白を埋めるために EAGLE3 ベースのドラフターを自前で訓練・公開しており、今回の公式リリースはその要望を後追いで取り込んだ形です[2][4]。
まとめ
Google が公開した Gemma 4 用 MTP ドラフターは、Apache 2.0 ライセンスで配布される投機的デコード向けの軽量モデルで、推論を最大 3 倍に高速化できるとされています。実測値はハードウェアやバッチサイズで大きく揺らぎ、Apple Silicon の MoE モデルでは約 2.2 倍、コミュニティ製の EAGLE3 では約 1.72 倍といった先行例もあります。Hugging Face や Kaggle、AI Edge Gallery から実際に試せるため、自分のワークロードでどこまで効くかを確かめてから本番に投入するのが現実的な進め方になりそうです。
出典:[1] Google「Accelerating Gemma 4: faster inference with multi-token prediction drafters」(https://blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/)
出典:[2] FlowHunt「Gemma 4 Was Released Without MTP Data — Here's Why That Matters」(https://www.flowhunt.io/blog/gemma-4-released-without-mtp-multi-token-prediction/)
出典:[3] Yaniv Leviathan, Matan Kalman, Yossi Matias「Fast Inference from Transformers via Speculative Decoding」arXiv:2211.17192 (https://arxiv.org/abs/2211.17192)
出典:[4] Hugging Face Blog「Google Released Gemma-4 Four Days Ago. We Already Made It 1.72× Faster.」(https://huggingface.co/blog/lujangusface/tw-eagle3-gemma4)
