Google DeepMind 於當地時間 2026 年 6 月 10 日發表實驗性開放模型 DiffusionGemma,主打超高速文字生成[1]。這款模型不再逐字輸出,而是採用與圖像生成 AI 類似的擴散方式,從雜訊中一次還原出整塊文字。NVIDIA 宣布已針對 GeForce RTX、DGX Spark 等自家 GPU 對該模型進行最佳化[1]。在單一使用者的工作負載下,其生成速度最高可達同等傳統模型的 4 倍[1]。

以「區塊」為單位生成文字的新方式

目前廣泛使用的大型語言模型(LLM)幾乎都是自迴歸型,也就是依賴前一個字詞、逐 token 生成文字。對話 AI 像打字機一樣逐字輸出回答,正是源自這個機制[1]。

DiffusionGemma 走的是完全不同的路線。它如同圖像的擴散模型,從雜訊狀態出發、對整塊文字逐步去噪還原,每一步可平行生成最多 256 個 token[1]。可以說,這是一個以區塊為單位思考、而非逐字推進的模型。

模型以 260 億參數的混合專家(Mixture-of-Experts)模型 Gemma 4 為基礎打造,每一步實際啟用的參數僅 38 億[1]。其架構是在 Gemma 4 之上組合擴散頭[1]。DiffusionGemma 以寬鬆的 Apache 2.0 授權釋出開放權重,不需雲端、沒有按 token 計費,可完全在本地的 RTX 與 DGX Spark 上執行[1]。

為什麼在 GPU 上會更快

逐 token 生成本質上是受記憶體頻寬限制的處理。在批次大小為 1(單一使用者)的情況下,傳統 LLM 大部分時間都耗在等待記憶體而非運算[1],GPU 的運算能力處於閒置狀態。

擴散方式則逆轉了這個格局。將 256 個 token 的整塊文字一次送入 Transformer,是以運算為主的工作負載,正是 GPU 最擅長的領域[1]。NVIDIA Tensor 核心可加速密集的平行運算,搭配 CUDA 軟體堆疊,模型不需特別調校即可從第一天起高效執行[1]。

實測數據也已公開。DiffusionGemma 在單顆 H100 GPU 上以批次大小 1 達到每秒 1,000 個 token 的生成速度,在桌邊 AI 裝置 DGX Spark 上為每秒 150 個 token,在 DGX Station 上最高可達每秒 2,000 個 token,約為同等自迴歸模型的 4 倍[1]。這代表聊天回應與代理推理迴圈的等待時間將明顯縮短。

從本地 PC 到工作站的廣泛支援

這款模型可在 NVIDIA 的完整產品線上執行,這一點同樣值得關注[1]。

  • DGX Spark:搭載 GB10 Grace Blackwell 超級晶片與 128GB 統一記憶體的桌邊個人 AI 超級電腦,憑藉預先安裝的 AI 軟體堆疊,可立即用於原型開發與完全本地化的代理工作流程[1]
  • RTX PRO 6000 工作站:讓開發者與研究人員在專業工作流程中執行低延遲生成與代理迴圈時擁有充足餘裕[1]
  • DGX Station:配備 748GB 一致性記憶體,提供最高每秒 2,000 個 token 的同級最佳推理效能[1]
  • GeForce RTX:llama.cpp 支援即將推出[1]

入門途徑也已備妥。透過 Hugging Face Transformers,模型可在 GeForce RTX 5090 或 DGX Spark 上開箱即用;若需要更高吞吐量,vLLM 已提供首日服務支援[1]。針對特定任務的調整,可透過 Unsloth 與 NVIDIA NeMo 框架進行微調,並備有面向 DGX Spark 的現成手冊[1]。使用者可在 Hugging Face 上直接試用,也可透過 build.nvidia.com 的 NVIDIA 託管 API 免費測試[1]。

總結

DiffusionGemma 是一款實驗性開放模型,透過基於擴散的平行生成,將本地 AI 長期以來的弱點——單一使用者的生成速度——最高提升至 4 倍[1]。它以 Apache 2.0 授權釋出,可完全在 RTX 與 DGX Spark 上執行,對想在不增加雲端成本的前提下打造高速本地代理的開發者而言,是相當有吸引力的選擇。如果 llama.cpp 的支援能將其推廣到更廣大的 GeForce RTX 使用者族群,它或許會成為本地 LLM 的新主流方式。

來源:[1] https://blogs.nvidia.com/blog/rtx-ai-garage-local-gemma-diffusion/