Google DeepMindは現地時間2026年6月10日、文章を高速に生成する実験的なオープンモデル「DiffusionGemma」を公開しました[1]。画像生成AIのように「ノイズから文章全体を一気に磨き上げる」拡散方式を採用しており、NVIDIAはこのモデルをGeForce RTXやDGX Sparkなど自社GPU向けに最適化したと発表しています[1]。1語ずつ生成する従来型と比べ、単独ユーザーの利用で最大4倍の速度を実現するのが特徴です[1]。

文章を「ブロック単位」で生成する新方式

現在広く使われている大規模言語モデル(LLM)のほとんどは自己回帰型と呼ばれ、直前の単語に依存しながら1トークンずつ文章を生成します。対話AIがタイプライターのように1文字ずつ答えを打ち出していくのは、この仕組みによるものです[1]。

DiffusionGemmaはまったく違うアプローチを取ります。画像生成の拡散モデルと同じように、ノイズの状態から文章のかたまり全体を段階的にデノイズ(復元)していく方式で、1ステップあたり最大256トークンを並列に生成します[1]。逐次ではなくブロック単位で考えるモデルと言えるでしょう。

ベースとなっているのは260億パラメータのMixture-of-Experts(専門家混合)モデル「Gemma 4」で、1ステップで実際に動くのは38億パラメータのみです[1]。このGemma 4のアーキテクチャに拡散ヘッドを組み合わせた構成になっています[1]。モデルはApache 2.0ライセンスのオープンウェイトで公開されており、クラウドもトークン課金も不要で、手元のRTXやDGX Spark上で完結して動かせます[1]。

なぜGPUで速くなるのか

1トークンずつの生成は本質的にメモリ帯域がボトルネックになる処理で、バッチサイズ1(ユーザー1人分)の場合、従来型LLMは計算ではなくメモリ待ちに大半の時間を費やしてしまいます[1]。GPUの計算能力を持て余している状態です。

拡散方式はこの構図を逆転させます。256トークンのブロックをまとめてTransformerに通す処理は計算量が支配的なワークロードで、まさにGPUが得意とする領域です[1]。NVIDIAのTensorコアが密な並列演算を加速し、CUDAソフトウェアスタックにより特別なチューニングなしで初日から効率的に動作するとしています[1]。

実測値も公開されています。DiffusionGemmaはH100 GPU1基でバッチサイズ1のとき毎秒1,000トークンを生成し、デスクサイドAIマシンのDGX Sparkでは毎秒150トークン、DGX Stationでは最大毎秒2,000トークンと、同等の自己回帰型モデルと比べおよそ4倍の速度を達成しています[1]。チャットの応答待ちやエージェントの思考ループが体感で大きく短縮される計算です。

ローカルPCからワークステーションまで幅広く対応

NVIDIAのラインアップ全体で動作する点もポイントです[1]。

  • DGX Spark: GB10 Grace Blackwell Superchipと128GBのユニファイドメモリを搭載するデスクサイドの個人向けAIスーパーコンピューター。プリインストールのAIソフトウェアスタックでプロトタイピングやローカルエージェントをすぐ試せます[1]
  • RTX PRO 6000ワークステーション: 開発者や研究者が業務フローの中で低遅延生成やエージェントループを回せる余裕を提供します[1]
  • DGX Station: 748GBのコヒーレントメモリを備え、最大毎秒2,000トークンのクラス最高水準の推論を実現します[1]
  • GeForce RTX: llama.cppによるサポートが近日提供予定です[1]

試す方法も整っています。Hugging Face Transformersを使えばGeForce RTX 5090やDGX Spark上でそのまま実行でき、より高いスループットが必要ならvLLMが公開初日からサービングに対応しています[1]。特定タスクへの適応にはUnslothやNVIDIA NeMoフレームワークでのファインチューニングが利用でき、DGX Spark向けのプレイブックも用意されています[1]。Hugging Faceで直接試せるほか、build.nvidia.comのNVIDIAホスト型APIで無料でテストすることも可能です[1]。

まとめ

DiffusionGemmaは、拡散方式による並列生成でローカルAIの弱点だった単独ユーザー時の生成速度を最大4倍に引き上げる実験的オープンモデルです[1]。Apache 2.0で公開され、RTXやDGX Sparkで完結して動くため、クラウド費用を気にせず高速なローカルエージェントを組みたい開発者には魅力的な選択肢になりそうです。llama.cpp対応でGeForce RTXユーザーの裾野まで広がれば、ローカルLLMの新しい定番方式になるかもしれません。

出典: [1] https://blogs.nvidia.com/blog/rtx-ai-garage-local-gemma-diffusion/