Google、拡散型テキスト生成の実験的オープンモデル「DiffusionGemma」を公開 - GPU上で最大4倍高速

Googleが2026年6月10日、テキスト拡散を採用した26B MoEの実験的オープンモデルDiffusionGemmaを公開。H100で毎秒1000トークン超を実現する一方、出力品質はGemma 4より低いというトレードオフも明示している。

Google、拡散型テキスト生成の実験的オープンモデル「DiffusionGemma」を公開 - GPU上で最大4倍高速

Googleは2026年6月10日、テキスト拡散(text diffusion)方式を採用した実験的なオープンモデル「DiffusionGemma」を公開した12。通常のLLMが採用する自己回帰型の逐次的なトークン生成とは異なり、テキストブロック全体を同時に生成するアプローチで、GPU上で最大4倍高速なテキスト生成をうたう1。Apache 2.0ライセンスで提供され、モデルウェイトはHugging Faceから入手できる1

Googleはこのモデルを、既存の自己回帰型Gemma 4を置き換えるものではなく補完する位置づけとしており1、品質より速度を優先する用途に向けた選択肢として提示している。

画像生成のように「全体を一度に描いて磨き上げる」

DiffusionGemmaの生成プロセスは、画像の拡散モデルに似ている。まず「ランダムなプレースホルダートークンのキャンバス」から開始し、複数のパスを重ねて正しいトークンを確定させ、確定したトークンをコンテキストの手がかりとして残りを洗練していく1。1トークンずつ順番に書き進めるのではなく、文章全体を一度に下書きして段階的に仕上げていくイメージだ。

これを支えるのが双方向アテンション(Bi-directional attention)で、1回のフォワードパスで256トークンを並列に生成する12

性能とアーキテクチャ - 推論時はアクティブ3.8Bの26B MoE

性能面では、NVIDIA H100単体で毎秒1000トークン以上、コンシューマー向けのNVIDIA GeForce RTX 5090でも毎秒700トークン以上の生成速度を実現したとしている12

アーキテクチャは26BパラメータのMixture of Experts(MoE)モデルで、推論時にアクティブになるのは3.8Bパラメータのみ1量子化すればハイエンドのコンシューマー向けGPUが持つ18GB VRAMの制限内に収まるとされ、ローカル環境での実行を意識した設計になっている1

デプロイ手段としてはMLX、vLLM、Hugging Face Transformersに対応するほか、Gemini Enterprise Agent PlatformのModel GardenやNVIDIA NIM経由でも利用できる1

品質とのトレードオフを明示 - Apple Siliconでは恩恵なし

注目すべきは、Google自身が制限事項を明確に示している点だ。公式ブログは「DiffusionGemmaの全体的な出力品質は標準のGemma 4より低い」と明記し、最高品質が求められる用途には標準のGemma 4のデプロイを推奨している1

また、速度向上の恩恵は専用GPUに限られ、Apple SiliconのMacのようなユニファイドメモリアーキテクチャでは得られないという1。適した用途としては、インライン編集や高速な反復のような、速度が重要なインタラクティブでローカルなワークフローが挙げられている1

拡散型のテキスト生成は研究分野として以前から探求されてきたが、Apache 2.0ライセンスの実用規模なオープンモデルとして重みまで公開される例はまだ少ない。速度と品質のトレードオフを踏まえた上で、まずは手元のGPUで試してみたい開発者にとっては扱いやすいリリースといえる。モデルの詳細はGoogle公式ブログ1を、ウェイトはHugging Faceで確認できる。

Sources

  1. DiffusionGemma: 4x faster text generation - Google公式ブログ(2026年6月10日)
  2. Google open-sources speedy DiffusionGemma text diffusion model - SiliconANGLE(2026年6月10日)

最新のAIニュースを毎日お届けしています。

RSSで購読する 更新をいち早くチェックできます。

他のキーワードで探す →