Google發表了開放AI模型「Gemma 4」的省記憶體版本「Gemma 4 QAT」。它在訓練階段就預先納入量化,在大幅降低記憶體用量的同時,抑制了回應品質的下降。最輕量的配置僅需0.84GB記憶體即可執行,讓人們能直接在手邊的智慧型手機或筆記型電腦上執行AI。該模型免費提供,採用Apache License 2.0授權。

在本機執行高效能AI的門檻

在電腦或手機上於本機執行AI模型時,會先將模型載入速度很快的顯示記憶體(VRAM)。放不下的部分會轉入相對較慢的記憶體(RAM),若記憶體也不夠,就會被擠到SSD上的置換檔案,執行速度也隨之下降。想要順暢執行,就必須選擇能放進顯示記憶體的模型。

然而高效能模型的記憶體用量往往高達數十GB甚至數百GB,遠超家用設備所能負荷。為此,人們一直採用透過降低運算精度來減少記憶體用量的「量化」技術。

「QAT」抑制品質下降的原理

量化在節省記憶體方面很有效,但由於會降低運算精度,回應品質往往容易隨之下滑。目前廣為流通的量化模型大多是在模型完成後才施加量化,因此更容易受到這種影響。

Gemma 4 QAT採用的是「Quantization-Aware Training(QAT,考慮量化的訓練)」方法。由於在訓練階段就模擬量化後的狀態進行訓練,因此即使最終進行量化,品質也不易下降。在省記憶體與維持品質之間取得兼顧,正是這次模型的核心所在。

支援的模型與記憶體用量的削減

Gemma 4 QAT支援Gemma 4的「E2B」「E4B」「12B」「26B A4B」「31B」全部版本。此外,E2B與E4B還提供了針對行動用途最佳化的版本。

記憶體削減效果顯著。例如Gemma 4 E2B的原始模型需要11.4GB記憶體,而QAT版(Q4_0,4位元)則縮減至2.9GB。行動版本僅需1.1GB,拿掉影像與音訊辨識功能的純文字模型更是只需0.84GB即可執行。Google表示,其他尺寸的模型同樣能在抑制品質下降的前提下大幅減少記憶體用量。

取得方式與可執行的環境

Gemma 4 QAT的各款模型以合集的形式在Hugging Face上發布,任何人都能免費下載。授權為Apache License 2.0,允許包含商用在內的廣泛用途。在執行環境方面,Google明確表示這些模型可以直接在本機端AI常用工具llama.cpp、Ollama與LM Studio上執行。能夠輕鬆融入人們日常使用的工具、隨時上手,是它的一大優勢。

總結

Gemma 4 QAT透過在訓練階段納入量化的QAT方法,實現了省記憶體與維持品質的兼顧。部分配置可將記憶體用量從原本的11.4GB削減到最低0.84GB,讓在智慧型手機或筆記型電腦上於本機執行高效能AI變得更加實際。再加上以Apache License 2.0免費提供、可在llama.cpp、Ollama與LM Studio上立即執行的便利,對於想在自己裝置上執行AI的人來說,可說是一個很值得一試的選擇。