核心概念

DiffusionGemma 是 Google DeepMind 於 2026 年 6 月 10 日發布的實驗性開源模型,代表著文本生成技術的一次範式轉移:它將圖像生成領域的「擴散模型」思想移植到語言模型,打破了傳統逐字預測(autoregressive)的生成瓶頸。

兩種生成模式的根本差異

傳統大語言模型(如 GPT、Gemma)採用自回歸(autoregressive)架構:每次只能預測下一個 token,必須等前一個 token 確定後才能生成下一個,本質上是串行計算。這個設計在語義連貫性上表現優異,但 GPU 的並行計算能力大量閒置。

DiffusionGemma 換了一套邏輯:從一個全部填滿隨機佔位符的「草稿」出發,每輪迭代同時精煉整個 256 個 token 的文本塊,直到所有 token 收斂為最終輸出。這就像素描師從模糊輪廓逐步收斂到清晰線條,而非從左到右一筆一畫。

這個設計的關鍵優勢在於:完全釋放 GPU 的並行計算能力。H100 每秒可輸出逾 1,100 個 token,RTX 5090 亦達 700+ token/秒,相比等效自回歸模型快約 4 倍。

架構細節

DiffusionGemma 建立在 Gemma 4 26B MoE(混合專家)架構之上,關鍵參數如下:

規格 數值
總參數量 25.2B(26B MoE)
推理時啟動參數 3.8B(稀疏 MoE)
專家數量 128 個,每次啟動 8 個
每次生成塊大小 256 個 token
VRAM 需求(量化後) 18GB
授權 Apache 2.0

MoE 設計讓模型在具備強大語義理解的同時,推理時只激活 3.8B 的參數量,大幅降低本地部署門檻——消費級顯卡 RTX 5090 即可運行。

另一個架構差異:DiffusionGemma 使用雙向注意力(bidirectional attention),能同時參考左右兩側的上下文;傳統自回歸模型只能看左側。這讓它在「補全中間空白」類任務上先天具有優勢。

關鍵要點

  • 速度優先,品質次之:DiffusionGemma 在通用知識(MMLU Pro)上與自回歸 Gemma 4 差距僅約 5 分,但多步數學推理(AIME 2026)差距擴大到 19.2 分。速度換品質的取捨是設計前提,非缺陷。

  • 本地部署的甜蜜點:消費端 GPU(18GB VRAM)即可運行,且 1,000+ token/秒的速度讓即時互動體驗成真。雲端高並發場景仍適合傳統自回歸架構,本地單用戶場景則是擴散模型的主場。

  • 雙向上下文的獨特優勢:代碼填充(fill-in-the-middle)、行內編輯、非線性文本結構等任務天然需要雙向上下文,DiffusionGemma 在這類場景下與自回歸模型的品質差距顯著縮小。

  • 開源生態完備:支援 vLLM、Hugging Face Transformers、MLX 三大推理框架,NVIDIA 已提供 NVFP4 量化版本,Unsloth 提供 GGUF 格式,部署鏈路成熟。

  • 擴散 LLM 的更大意義:DiffusionGemma 不是孤例,而是擴散語言模型(DLM)研究浪潮的重要里程碑。LLaDA、Dream 等模型已在多個 benchmark 上達到競爭性水準,確立了擴散模型作為自回歸替代方案的可行性。

實務應用

適合 DiffusionGemma 的場景

  • 實時互動 AI 助手:1,000+ token/秒讓打字感消失,對話體驗接近真人速度
  • 本地隱私優先的代碼補全:IDE 行內補全、代碼重構,雙向注意力提升準確率
  • 快速迭代內容生成:需要反覆生成、挑選、再生成的創意工作流,速度降低等待成本
  • 邊緣設備部署:18GB VRAM 門檻讓消費級硬體也能跑大參數模型的品質

不適合的場景

  • 需要最高品質的多步推理(數學競賽、複雜邏輯鏈)
  • 雲端高並發服務(自回歸模型在批量推理吞吐量上仍有優勢)

延伸觀點

擴散語言模型的研究社群正在快速演化,DiffusionGemma 的發布可以視為「生產可用」的信號,但學術界圍繞速度與品質的博弈遠未結束。

並行解碼的隱藏成本:多篇 arxiv 論文(Fast-dLLM、DAWN 等)指出,擴散模型的「並行生成」並不自動等於更快推理。每一步去噪都需要完整的雙向注意力計算(而非自回歸的下三角 mask),在未優化情況下每步計算量更大。DiffusionGemma 能實現 4 倍速度提升,部分歸功於 MoE 稀疏激活設計——稀疏 MoE 降低了每步的有效 FLOP 數,補償了雙向注意力的計算開銷。這也意味著擴散模型的速度優勢與架構設計深度耦合,不能簡單套用到所有擴散 LLM。

推理時優化是新主戰場:學界已有多種訓練無關(training-free)的推理加速方法,如 DUS(Dilated Unmasking Scheduler)透過稀疏解碼步驟規劃進一步減少迭代次數,Fast-dLLM 實現了 2.5 倍額外加速。這表示 DiffusionGemma 的 4 倍優勢可能只是起點,推理優化空間仍大。

品質差距的結構性原因:擴散模型在複雜推理上落後自回歸模型,根本原因在於「一次精煉整塊」的機制難以模擬人類解題時的逐步演繹。自回歸模型每步只決定一個 token,強迫自身顯式維護推理鏈;擴散模型同時優化整塊,推理鏈的形成是隱式的。未來可能的方向是混合架構:自回歸生成思維鏈,擴散模型生成最終答案。

Sources:

反向連結

以下頁面引用了本頁: