谷歌发布了开放AI模型「Gemma 4」的省内存版本「Gemma 4 QAT」。它在训练阶段就预先纳入量化,在大幅降低内存占用的同时,抑制了回答质量的下降。最轻量的配置仅需0.84GB内存即可运行,让人们可以在手边的智能手机或笔记本电脑上本地运行AI。该模型免费提供,采用Apache License 2.0许可证。
在本地运行高性能AI的门槛
在电脑或手机上本地运行AI模型时,会先把模型加载到速度很快的显存(VRAM)中。放不下的部分会被转入相对较慢的内存(RAM),如果内存也不够,就会被挤到SSD上的交换文件里,运行速度也随之下降。要想流畅运行,就必须选择能装进显存的模型。
然而高性能模型的内存占用常常高达数十GB乃至数百GB,远超家用设备的承受能力。为此,人们一直采用通过降低计算精度来减少内存占用的「量化」技术。
「QAT」抑制质量下降的原理
量化在节省内存方面很有效,但由于会降低计算精度,回答质量往往容易随之下滑。目前广泛流通的量化模型大多是在模型完成后再施加量化,因此更容易受到这种影响。
Gemma 4 QAT采用的是「Quantization-Aware Training(QAT,感知量化的训练)」方法。由于在训练阶段就模拟量化后的状态进行训练,因此即使最终进行量化,质量也不易下降。在省内存与保持质量之间取得兼顾,正是这次模型的核心所在。
支持的模型与内存占用的削减
Gemma 4 QAT支持Gemma 4的「E2B」「E4B」「12B」「26B A4B」「31B」全部变体。此外,E2B和E4B还提供了针对移动用途优化的版本。
内存削减效果显著。例如Gemma 4 E2B的原始模型需要11.4GB内存,而QAT版(Q4_0,4比特)则缩减到2.9GB。移动版本仅需1.1GB,去掉图像和音频识别功能的纯文本模型更是只需0.84GB即可运行。谷歌表示,其他尺寸的模型同样能在抑制质量下降的前提下大幅减少内存占用。
获取方式与可运行环境
Gemma 4 QAT的各款模型以合集的形式在Hugging Face上发布,任何人都可以免费下载。许可证为Apache License 2.0,允许包括商用在内的广泛用途。在运行环境方面,谷歌明确表示这些模型可以直接在本地AI常用工具llama.cpp、Ollama和LM Studio上运行。能够轻松融入人们日常使用的工具、随时上手,是它的一大优势。
总结
Gemma 4 QAT通过在训练阶段纳入量化的QAT方法,实现了省内存与保持质量的兼顾。部分配置可将内存占用从原本的11.4GB削减到最低0.84GB,让在智能手机或笔记本电脑上本地运行高性能AI变得更加现实。再加上以Apache License 2.0免费提供、可在llama.cpp、Ollama和LM Studio上即刻运行的便利,对于想在自己设备上运行AI的人来说,可以说是一个很值得一试的选择。
