核心概念
Google DeepMind 於 2026 年 6 月 3 日發布 Gemma 4 12B,定位為首款中型無編碼器(encoder-free)多模態開源語言模型。與傳統多模態架構需要獨立視覺編碼器或音頻編碼器不同,Gemma 4 12B 採用統一解碼器架構,所有模態的輸入均直接映射至語言模型的嵌入空間,無需任何前置編碼模組。
架構核心
視覺方面,模型使用僅 3500 萬參數的輕量嵌入模組,取代傳統 27 層 Vision Transformer,將原始 48×48 像素圖塊透過單一矩陣乘法、位置嵌入與歸一化直接投影至 LLM 隱藏維度空間。音頻方面,以 16 kHz 取樣的音頻信號被切成 40 毫秒幀(640 個數值),直接線性投影至輸入空間,完全省去原本需要 12 層 Conformer 的音頻編碼器。
整體規格:11.95B 參數、48 層、256K token 上下文窗口、262K 詞彙量。注意力機制採用混合式設計,在本地滑動窗口注意力(1024 token)與全局注意力之間交替,並採用 Proportional RoPE(p-RoPE)優化記憶體使用。
多模態能力範疇
| 模態 | 規格限制 |
|---|---|
| 圖像 | 可變長寬比,視覺 token 預算 70~1120 可調 |
| 音頻 | 最長 30 秒 |
| 影片 | 最長 60 秒,1 FPS |
因視覺、音頻、文本共享完全相同的模型權重,微調時不再需要協調多個凍結編碼器,可一次端對端訓練整個模型,顯著降低領域適應的技術門檻。
關鍵要點
- 效能定位:MMLU Pro 77.2%、AIME 2026 77.5%(無工具)、GPQA Diamond 78.8%、LiveCodeBench v6 72.0%,整體性能接近 26B MoE 模型,記憶體佔用不到一半
- 本地可執行:16GB VRAM 消費級硬體(如 16GB 記憶體筆電)即可運行完整模型
- 開源授權:Apache 2.0,可商業使用,模型權重可在 Hugging Face(
google/gemma-4-12B)與 Kaggle 下載 - 工具生態:原生支援 Transformers、Ollama、LM Studio、llama.cpp、vLLM、MLX、SGLang;可透過 Unsloth 進行微調
- 生成加速:配備多 token 預測(MTP)草稿機制降低推論延遲
- 代理支援:整合 Gemma Skills 官方資源庫,支援代理(agentic)工作流程
實務應用
社群開發者已運用 Gemma 4 12B 建構可穿戴機械臂的視覺輔助系統與企業級 AI 安全解決方案。部署選項涵蓋 Google Cloud Run、GKE 及 Gemini Enterprise Agent Platform;本地端可透過 LiteRT-LM CLI 啟動 OpenAI 相容的本地伺服器,macOS 上也有 Google AI Edge Gallery 原生應用支援。
視覺 token 預算的靈活設定讓同一模型能在不同任務間調節計算量:低預算(70 token)適合圖像分類與簡單描述,高預算(1120 token)則用於 OCR、文件解析等細節密集任務。
相關模型:DiffusionGemma:擴散式文本生成的速度革命 | Google DeepMind 聯合資助多Agent安全研究:千萬美元對抗湧現風險
延伸觀點
統一解碼器設計的真正意義不只是簡化架構,而是改變了多模態微調的成本結構。傳統做法中,凍結的視覺編碼器需與語言骨幹分開協調,容易出現特徵對齊漂移;Gemma 4 12B 共享權重的設計讓微調成為單一端對端優化問題(多個框架均已確認此優勢)。
256K 上下文窗口搭配 60 秒影片輸入(1 FPS)讓模型能分析完整的短片段而非孤立幀,為本地端的時序理解與多模態代理任務開啟了新可能。對比 Gemma 4 E4B(邊緣優先)與 26B MoE(效能優先),12B 填補了消費級 GPU 上的「可用效能缺口」,開發者不再需要在隱私(本地推論)與效能(雲端 API)之間二選一。
反向連結
以下頁面引用了本頁: