谷歌发布了一款可以只在本地笔记本上运行、无需连接云端的新开放模型「Gemma 4 12B」[1]。它约有120亿参数,却能在配备16GB内存的机器上本地运行,除文本外还能直接处理图像、音频和视频。模型权重以Apache 2.0许可证免费公开,有望扩大这种不必把数据上传云端、在本地即可完成的私密AI应用的普及范围。

可在16GB笔记本上运行的轻量开放模型

Gemma 4 12B作为谷歌6月推出的AI相关更新之一登场[1]。如果说Gemini负责云端一侧的顶级模型,那么Gemma则属于无需联网、可在终端本地运行的「开放模型」谱系。

它最大的卖点是无需专用服务器或GPU,只要一台配备约16GB内存的普通笔记本就能运行[1]。模型规模约为120亿参数(12B),与大型云端专用模型相比属于较为紧凑的一类[3]。即便如此,它仍能在本地完成高级推理,因此在处理不能外泄的数据、或在网络环境不稳定的现场使用时,都具有实用的优势[1]。

在分发方面同样开放。权重以Apache 2.0许可证免费公开,可从Hugging Face和Kaggle获取[3]。运行环境也支持vLLM、llama.cpp等标准执行框架,并已可在LM Studio、Ollama这类便捷的本地运行工具中使用,方便开发者集成到自己的环境中[3]。

没有编码器的「统一」架构

Gemma 4 12B在技术上的亮点,是谷歌称之为「统一(unified)」的无编码器设计[2]。传统的多模态模型通常先用专用的转换模块(编码器)处理图像和音频,再把结果交给核心语言模型。编码器往往会增加内存和处理时间的负担,也是拖慢运行速度的因素之一。

Gemma 4 12B省去了这一中间处理,把音频波形和图像数据直接送入核心语言模型[3]。由此,它能在同一套机制中直接处理文本、图像、音频和视频。谷歌将其定位为一款无需经过专用编码器即可处理音频与视频的中等规模开放模型[2][3]。

它一次能读入的信息量也很大,上下文窗口达到25.6万个词元(256K)[3]。这足以把冗长的会议记录、大规模源代码或篇幅较多的资料一次性放入工作内存,作为本地运行的模型来说,可处理素材的范围相当广。

目标是可在本地运行的AI智能体

谷歌将Gemma 4 12B描述为实现「在笔记本上运行的智能AI智能体」的基础[1]。通过把视觉与原生的音频处理整合到同一套精简的机制中,它力求在日常硬件上也能兼顾高级推理与保护隐私的工作方式,而不牺牲速度[1]。

其背后是对在本地设备上运行AI的「端侧AI」日益增长的关注。只要不把处理交给云端,就能降低机密信息外泄的风险,也能减轻通信费和使用费的负担。分发开放权重的模型便于企业和开发者集成到自有环境中用于此类场景,Gemma 4 12B正是顺应这一趋势的一步。

不过,这里提到的性能与特性目前主要基于谷歌自身的说明。实际的易用性与精度,要等到第三方的验证与基准测试逐渐齐备后才会有定论。由于开放模型的一大优点是任何人都能在本地试用,公开之后的实测与对比将成为下一个关注点。

总结

Gemma 4 12B是一款约120亿参数、即使在配备16GB内存的笔记本上也能运行的开放模型,并以Apache 2.0许可证免费公开。得益于没有编码器的统一架构,它不仅能处理文本,还能在同一套机制中处理图像、音频和视频,并支持25.6万词元的宽广上下文。它能否作为不依赖云端、在本地运行的AI智能体基础,在开发者与注重隐私的场景中扎根,值得关注。

出典:https://blog.google/innovation-and-ai/technology/ai/google-ai-updates-june-2026/

出典:https://blog.google/innovation-and-ai/technology/developers-tools/introducing-gemma-4-12b/

出典:https://venturebeat.com/technology/googles-new-open-source-gemma-4-12b-analyzes-audio-video-and-runs-entirely-locally-on-a-typical-16gb-enterprise-laptop