谷歌 DeepMind 于当地时间 2026 年 6 月 10 日发布了实验性开放模型 DiffusionGemma,主打超高速文本生成[1]。该模型不再逐词输出,而是采用与图像生成 AI 类似的扩散方式,从噪声中一次性还原出整块文本。NVIDIA 宣布已针对 GeForce RTX、DGX Spark 等自家 GPU 对该模型进行了优化[1]。在单用户工作负载下,其生成速度最高可达同等传统模型的 4 倍[1]。
以"块"为单位生成文本的新方式
目前广泛使用的大语言模型(LLM)几乎都是自回归型,即依赖前一个词逐 token 生成文本。对话 AI 像打字机一样逐字输出回答,正是源于这一机制[1]。
DiffusionGemma 采取了完全不同的路径。它像图像扩散模型一样,从噪声状态出发对整块文本逐步去噪还原,每一步可并行生成最多 256 个 token[1]。可以说,这是一个以块为单位思考、而非逐词推进的模型。
该模型基于 260 亿参数的混合专家(Mixture-of-Experts)模型 Gemma 4 构建,每一步实际激活的参数仅为 38 亿[1]。其架构是在 Gemma 4 的基础上组合了扩散头[1]。模型以宽松的 Apache 2.0 许可证开放权重发布,无需云端、无按 token 计费,可完全在本地的 RTX 和 DGX Spark 上运行[1]。
为什么在 GPU 上会更快
逐 token 生成本质上是受内存带宽制约的处理。在批大小为 1(单个用户)的情况下,传统 LLM 的大部分时间都耗在等待内存而非计算上[1],GPU 的算力处于闲置状态。
扩散方式则逆转了这一格局。将 256 个 token 的整块文本一次性送入 Transformer,是以计算为主导的工作负载,正是 GPU 最擅长的领域[1]。NVIDIA Tensor Core 可加速密集的并行运算,配合 CUDA 软件栈,模型无需专门调优即可从第一天起高效运行[1]。
实测数据也已公布。DiffusionGemma 在单块 H100 GPU 上以批大小 1 实现每秒 1,000 个 token 的生成速度,在桌边 AI 设备 DGX Spark 上为每秒 150 个 token,在 DGX Station 上最高可达每秒 2,000 个 token,约为同等自回归模型的 4 倍[1]。这意味着聊天响应和智能体推理循环的等待时间将明显缩短。
从本地 PC 到工作站的广泛支持
该模型可在 NVIDIA 的全线产品上运行,这一点同样值得关注[1]。
- DGX Spark:搭载 GB10 Grace Blackwell 超级芯片和 128GB 统一内存的桌边个人 AI 超级计算机,凭借预装的 AI 软件栈,可立即用于原型开发和完全本地化的智能体工作流[1]
- RTX PRO 6000 工作站:为开发者和研究人员在专业工作流中运行低延迟生成和智能体循环提供充足余量[1]
- DGX Station:配备 748GB 一致性内存,提供最高每秒 2,000 个 token 的同级最佳推理性能[1]
- GeForce RTX:llama.cpp 支持即将推出[1]
上手途径也已就绪。通过 Hugging Face Transformers,模型可在 GeForce RTX 5090 或 DGX Spark 上开箱即用;如需更高吞吐量,vLLM 已提供首日服务支持[1]。针对特定任务的适配,可通过 Unsloth 和 NVIDIA NeMo 框架进行微调,并提供了面向 DGX Spark 的现成手册[1]。用户可在 Hugging Face 上直接试用,也可通过 build.nvidia.com 的 NVIDIA 托管 API 免费测试[1]。
总结
DiffusionGemma 是一款实验性开放模型,通过基于扩散的并行生成,将本地 AI 一直以来的弱点——单用户生成速度——最高提升至 4 倍[1]。它以 Apache 2.0 许可证发布,可完全在 RTX 和 DGX Spark 上运行,对希望在不增加云端成本的前提下构建高速本地智能体的开发者来说,是颇具吸引力的选择。如果 llama.cpp 的支持能将其推广到更广泛的 GeForce RTX 用户群,它或许会成为本地 LLM 的新主流方式。
来源:[1] https://blogs.nvidia.com/blog/rtx-ai-garage-local-gemma-diffusion/
