核心概念
JetBrains 於 2026 年 6 月發布 Mellum2,一個 12B 參數的 Mixture-of-Experts(MoE)開源語言模型,採用 Apache 2.0 授權。相較於前代 Mellum(專注於程式碼補全的單一任務模型),Mellum2 大幅擴展支援範圍,涵蓋自然語言與軟體工程任務,同時保持推理效率優勢。
核心架構規格:
| 特性 | 數值 |
|---|---|
| 總參數 | 12B(120 億) |
| 每 token 活躍參數 | 2.5B(25 億) |
| 模型類型 | Mixture-of-Experts (MoE) |
| 授權 | Apache 2.0 |
MoE 架構的核心優勢在於「稀疏激活」:每個 token 只調用 2.5B 的活躍參數,而非全部 12B。這讓模型在維持高容量(知識儲存空間大)的同時,顯著降低每次推理的實際計算量。相比同參數規模的 Dense 模型,推理速度提升超過 2 倍。
JetBrains 提出「焦點模型(Focal Model)」概念,明確定義 Mellum2 的設計定位:不是要取代系統中的主力大型模型,而是作為多模型架構中的高頻任務加速器。核心邏輯是——大型模型(如 70B+)擅長複雜推理,但在路由判斷、上下文壓縮、工具選擇等重複性輕量任務上用大模型是資源浪費。Mellum2 定位於這些中間層任務。
關鍵要點
- 推理效率是核心賣點:每 token 僅激活 2.5B 參數,實際推理成本遠低於同規模 Dense 模型,延遲低且吞吐量高,適合高頻呼叫場景
- 聚焦三類應用場景:
- 路由與編排:提示詞分類、工具選擇、控制流決策——這類任務不需要大模型的深度推理,但對延遲敏感
- RAG 管道:上下文壓縮、摘要生成、檢索後處理——作為 RAG 流程中的「預處理層」降低後端大模型的 context 負擔
- 子代理(Sub-agent):多代理系統中的規劃、驗證、轉換節點——代替大模型處理結構化程度高但不複雜的子任務
- 私有部署友好:開源 + Apache 2.0 授權,支援完全自託管,適合企業處理專有程式碼或內部敏感資料,不依賴外部 API
- 從程式碼模型進化為通用型:前代 Mellum 是純代碼補全模型,Mellum2 擴展為同時支援自然語言,適應 agentic 工作流的多樣化需求
- 評測表現:在代碼生成、推理能力、科學數學三類基準測試上與同規模開源模型性能相當,但推理速度高出 2 倍以上
實務應用
多代理系統中的部署模式:
在典型的多代理 AI 系統中,Mellum2 可以插入以下節點:
使用者請求
→ Mellum2(意圖分類 + 路由決策) ← 低延遲
→ 工具選擇子代理(Mellum2) ← 快速
→ 主力大模型(複雜推理) ← 深度
→ 上下文壓縮(Mellum2) ← 節省 Token
→ 最終回覆
這種分層架構可以顯著降低主力大模型的呼叫頻率,進而減少推論成本和整體延遲。
私有部署場景:對於不允許程式碼傳送至外部 API 的企業環境,Mellum2 作為本地部署的效率層特別有吸引力。Apache 2.0 授權意味著商業使用無障礙,且可針對特定領域進行微調。
對比 EMO 的設計思路:EMO:混合專家模型的湧現式模組化 探索的是 MoE 中的「湧現式模組化」——讓不同 Expert 自然分工專業化。Mellum2 則是 MoE 架構在產品化場景的具體落地,兩者代表 MoE 研究的理論探索與工程應用兩條路線。
與推論基礎設施的整合:Hugging Face 推論供應商生態系:DeepInfra 整合實錄 所描述的統一推論入口架構,正是 Mellum2 這類高效推論模型發揮最大價值的部署環境——透過 Inference Provider 以 API 形式呼叫,省去自行維護推論服務的成本。
相關訓練方法可參考 Granite 4.1 LLM 建構揭密——IBM 五階段訓練策略 的多階段訓練策略,作為同期開源 LLM 發展的參照脈絡。
延伸觀點
架構細節補充(多源驗證)
技術報告披露的完整規格比官方部落格更詳細:64 個 Expert 中每個 token 激活 8 個,共 28 個 Transformer 層,隱藏維度 2,304,使用 Grouped-Query Attention(32 個 query head、4 個 KV head)。上下文長度透過 layer-selective YaRN 擴展至 131,072 tokens。另一個值得注意的設計是 Multi-Token Prediction(MTP)頭——這讓模型具備內建的推測解碼(speculative decoding)能力,無需額外部署 draft model,進一步壓低推理延遲。
訓練資料達 10.6 兆 tokens,採三階段課程:從多元網路資料逐漸轉向精選程式碼與數學內容。Post-training 則使用 SFT 加上 RLVR(Reinforcement Learning with Verifiable Rewards),這與同期 Granite 4.1 等模型的訓練策略高度吻合,顯示 RLVR 已成為 2026 年開源 LLM 的標準後訓練手法。
評測結果的真實面貌
官方宣傳強調推理速度優勢,但實際基準呈現兩面性。EvalPlus 代碼生成得分 78.4、BFCL v3 函數呼叫 66.3 表現優異;但 LiveCodeBench v6 僅 37.2、GPQA Diamond 40.9,在複雜多步驟推理上明顯落後同規模競品。這與「焦點模型」定位一致——它本來就不是為深度推理設計的,但使用者應避免將其用於需要長鏈推理的場景。
MoE 的隱性成本
MoE 的效率優勢有一個常被忽略的前提:雖然每個 token 只激活部分 Expert,但所有 64 個 Expert 的權重必須同時載入記憶體。對於 Mellum2 的 12B 模型,實際 VRAM 需求仍是 12B 參數的完整量,並非 2.5B。這意味著推理速度快,但部署門檻(記憶體需求)並不比同規模 Dense 模型低——這是評估私有部署可行性時的關鍵考量。
反向連結
以下頁面引用了本頁: