核心概念
DiffusionGemma 是 Google DeepMind 於 2026 年 6 月 10 日發布的實驗性開源模型,代表著文本生成技術的一次範式轉移:它將圖像生成領域的「擴散模型」思想移植到語言模型,打破了傳統逐字預測(autoregressive)的生成瓶頸。
兩種生成模式的根本差異
傳統大語言模型(如 GPT、Gemma)採用自回歸(autoregressive)架構:每次只能預測下一個 token,必須等前一個 token 確定後才能生成下一個,本質上是串行計算。這個設計在語義連貫性上表現優異,但 GPU 的並行計算能力大量閒置。
DiffusionGemma 換了一套邏輯:從一個全部填滿隨機佔位符的「草稿」出發,每輪迭代同時精煉整個 256 個 token 的文本塊,直到所有 token 收斂為最終輸出。這就像素描師從模糊輪廓逐步收斂到清晰線條,而非從左到右一筆一畫。
這個設計的關鍵優勢在於:完全釋放 GPU 的並行計算能力。H100 每秒可輸出逾 1,100 個 token,RTX 5090 亦達 700+ token/秒,相比等效自回歸模型快約 4 倍。
架構細節
DiffusionGemma 建立在 Gemma 4 26B MoE(混合專家)架構之上,關鍵參數如下:
| 規格 | 數值 |
|---|---|
| 總參數量 | 25.2B(26B MoE) |
| 推理時啟動參數 | 3.8B(稀疏 MoE) |
| 專家數量 | 128 個,每次啟動 8 個 |
| 每次生成塊大小 | 256 個 token |
| VRAM 需求(量化後) | 18GB |
| 授權 | Apache 2.0 |
MoE 設計讓模型在具備強大語義理解的同時,推理時只激活 3.8B 的參數量,大幅降低本地部署門檻——消費級顯卡 RTX 5090 即可運行。
另一個架構差異:DiffusionGemma 使用雙向注意力(bidirectional attention),能同時參考左右兩側的上下文;傳統自回歸模型只能看左側。這讓它在「補全中間空白」類任務上先天具有優勢。
關鍵要點
-
速度優先,品質次之:DiffusionGemma 在通用知識(MMLU Pro)上與自回歸 Gemma 4 差距僅約 5 分,但多步數學推理(AIME 2026)差距擴大到 19.2 分。速度換品質的取捨是設計前提,非缺陷。
-
本地部署的甜蜜點:消費端 GPU(18GB VRAM)即可運行,且 1,000+ token/秒的速度讓即時互動體驗成真。雲端高並發場景仍適合傳統自回歸架構,本地單用戶場景則是擴散模型的主場。
-
雙向上下文的獨特優勢:代碼填充(fill-in-the-middle)、行內編輯、非線性文本結構等任務天然需要雙向上下文,DiffusionGemma 在這類場景下與自回歸模型的品質差距顯著縮小。
-
開源生態完備:支援 vLLM、Hugging Face Transformers、MLX 三大推理框架,NVIDIA 已提供 NVFP4 量化版本,Unsloth 提供 GGUF 格式,部署鏈路成熟。
-
擴散 LLM 的更大意義:DiffusionGemma 不是孤例,而是擴散語言模型(DLM)研究浪潮的重要里程碑。LLaDA、Dream 等模型已在多個 benchmark 上達到競爭性水準,確立了擴散模型作為自回歸替代方案的可行性。
實務應用
適合 DiffusionGemma 的場景:
- 實時互動 AI 助手:1,000+ token/秒讓打字感消失,對話體驗接近真人速度
- 本地隱私優先的代碼補全:IDE 行內補全、代碼重構,雙向注意力提升準確率
- 快速迭代內容生成:需要反覆生成、挑選、再生成的創意工作流,速度降低等待成本
- 邊緣設備部署:18GB VRAM 門檻讓消費級硬體也能跑大參數模型的品質
不適合的場景:
- 需要最高品質的多步推理(數學競賽、複雜邏輯鏈)
- 雲端高並發服務(自回歸模型在批量推理吞吐量上仍有優勢)
延伸觀點
擴散語言模型的研究社群正在快速演化,DiffusionGemma 的發布可以視為「生產可用」的信號,但學術界圍繞速度與品質的博弈遠未結束。
並行解碼的隱藏成本:多篇 arxiv 論文(Fast-dLLM、DAWN 等)指出,擴散模型的「並行生成」並不自動等於更快推理。每一步去噪都需要完整的雙向注意力計算(而非自回歸的下三角 mask),在未優化情況下每步計算量更大。DiffusionGemma 能實現 4 倍速度提升,部分歸功於 MoE 稀疏激活設計——稀疏 MoE 降低了每步的有效 FLOP 數,補償了雙向注意力的計算開銷。這也意味著擴散模型的速度優勢與架構設計深度耦合,不能簡單套用到所有擴散 LLM。
推理時優化是新主戰場:學界已有多種訓練無關(training-free)的推理加速方法,如 DUS(Dilated Unmasking Scheduler)透過稀疏解碼步驟規劃進一步減少迭代次數,Fast-dLLM 實現了 2.5 倍額外加速。這表示 DiffusionGemma 的 4 倍優勢可能只是起點,推理優化空間仍大。
品質差距的結構性原因:擴散模型在複雜推理上落後自回歸模型,根本原因在於「一次精煉整塊」的機制難以模擬人類解題時的逐步演繹。自回歸模型每步只決定一個 token,強迫自身顯式維護推理鏈;擴散模型同時優化整塊,推理鏈的形成是隱式的。未來可能的方向是混合架構:自回歸生成思維鏈,擴散模型生成最終答案。
Sources:
- Scaling Beyond Masked Diffusion Language Models
- Differences in Text Generated by Diffusion and Autoregressive LMs
- Fast-dLLM: Training-free Acceleration of Diffusion LLM
- google/diffusiongemma-26B-A4B-it on Hugging Face
- Plan for Speed: Dilated Scheduling for MDLMs
反向連結
以下頁面引用了本頁:
- Gemma 4 12B:統一無編碼器多模態模型(文章精選)
- OLMo Hybrid:混合模型預測哪些標記更好(文章精選)