Googleは、オープンなAIモデル「Gemma 4」の省メモリ版となる「Gemma 4 QAT」を公開しました。学習の段階で量子化をあらかじめ織り込む手法を採り、メモリ使用量を大きく抑えながら応答品質の低下を防いだのが特徴です。最も軽い構成ではわずか0.84GBのメモリで動作し、手元のスマートフォンやノートPCでもローカルでAIを動かせます。配布は無料で、ライセンスはApache License 2.0です。

高性能なAIを手元で動かすときの壁

AIモデルをパソコンやスマホでローカル実行するときは、まず処理が速いVRAMにモデルを読み込みます。VRAMに収まらない分は比較的低速なRAMへ、それでも足りなければSSD上のスワップ領域へと押し出され、動作はそのぶん遅くなります。快適に動かすには、VRAMに収まるサイズのモデルを選ぶことが欠かせません。

ところが高性能なモデルはメモリ使用量が数十GBから数百GBに達することも多く、家庭用の機材では手に余ります。そこで使われてきたのが、計算の精度を落としてメモリ使用量を減らす「量子化」と呼ばれる技術です。

「QAT」が品質低下を抑える仕組み

量子化はメモリ節約に有効な一方で、計算精度を落とす以上、どうしても応答品質が下がりやすいという弱点があります。広く出回っている量子化済みモデルの多くは、完成したモデルに後から量子化をかけたものなので、この影響を受けやすいものでした。

Gemma 4 QATが採用したのは「Quantization-Aware Training(QAT、量子化を考慮した学習)」という手法です。学習の段階であらかじめ量子化された状態をシミュレートしながら訓練するため、最終的に量子化しても品質が落ちにくくなります。省メモリ化と品質維持を両立させた点が、今回のモデルの核心です。

対応モデルと、削減されたメモリ使用量

Gemma 4 QATは、Gemma 4の「E2B」「E4B」「12B」「26B A4B」「31B」という全バリエーションに対応します。さらにE2BとE4Bには、モバイル用途に最適化したバージョンも用意されました。

メモリ削減の効果は大きく、たとえばGemma 4 E2Bは元のモデルだと11.4GBのメモリを必要としますが、QAT版(Q4_0、4ビット)では2.9GBまで縮みます。モバイル向けバージョンなら1.1GB、さらに画像や音声の認識機能を省いたテキスト専用モデルでは0.84GBという小ささで動作します。ほかのサイズのモデルでも、品質低下を抑えながら大幅にメモリ使用量を減らせるとしています。

入手方法と動かせる環境

Gemma 4 QATの各モデルはHugging Face上のコレクションで配布されており、誰でも無料でダウンロードできます。ライセンスはApache License 2.0で、商用を含め幅広い使い方が認められています。実行環境としては、ローカルAIで定番のllama.cppやOllama、LM Studioでそのまま動かせることが明言されています。普段使っているツールに組み込みやすく、すぐ試せるのは大きな利点です。

まとめ

Gemma 4 QATは、学習段階で量子化を織り込むQATによって、省メモリと品質維持を両立させたモデルです。元の11.4GBから最小0.84GBまでメモリ使用量を削れる構成もあり、スマートフォンやノートPCでも高性能なAIをローカルで動かせる現実味が増しました。無料かつApache License 2.0で配布され、llama.cppやOllama、LM Studioですぐ使える手軽さも含めて、手元でAIを動かしたい人にとって試す価値の高い選択肢と言えそうです。