核心概念
North Mini Code 是 Cohere 於 2026 年 6 月 9 日正式發布的首款面向開發者的程式碼模型,以 Apache 2.0 授權開源。這是一個 30B 參數(3B 活躍參數)的 Mixture-of-Experts(MoE)模型,專為 agentic 程式碼任務設計,核心賣點是「小而精」:推論時只啟動 3B 參數,卻在 Artificial Analysis Coding Index 取得 33.4 分,超越 Qwen3.5(35B-A3B)、Gemma 4(26B-A4B),以及遠更大的 Devstral 2(123B Dense)。
架構設計
North Mini Code 採用 Decoder-only Transformer 加稀疏 MoE,幾個值得注意的設計選擇:
- 混合 Attention 策略:Sliding-window attention(帶 RoPE 位置編碼)與 Global attention(無位置編碼)以 3:1 比例交錯,平衡局部上下文理解與長距離依賴
- Expert 路由:每個 FFN block 有 128 個 expert,每個 token 啟動 8 個;router 採用 sigmoid activation 再做 top-k 選擇(與常見 softmax 路由不同)
- 稀疏層前置 dense layer:第一層是 dense layer,再接稀疏 MoE 層,確保基礎特徵提取穩定
兩階段 SFT:從廣到深
第一階段:廣泛混合程式碼(70%)、Agentic tool-use(43%)與競賽/科學程式碼(27%),建立通用能力基礎。
第二階段:45 億 token,僅使用 agentic 與 reasoning 資料,全部經過可執行與正確性驗證;採用「long-to-longer cascade」,訓練長度從 64K 逐步延伸至 128K context。
最終 SFT 基準:SWE-Bench Verified pass@10 80.2%,Terminal-Bench v2 pass@10 55.1%。
非同步 RLVR 與 CISPO 演算法
強化學習部分採用自研的 CISPO 演算法(token-level importance sampling correction)。與標準 RLHF 的 prompt-level 校正不同,CISPO 在 token 層級做重要性採樣修正,避免長 agentic trace 被降權——這對需要多輪 tool-use 的程式碼代理至關重要。
訓練配置:
- Trainer 與 vLLM sidecar 並行,每 K=4 步更新 policy weights;FIFO queue 解耦 sampling 與 learning
- 每批 512 rollouts,group size 8,128K context window
- 獎勵:unit-test verifier 二元獎勵(pass/fail);無效 tool call 或無法解析輸出 → reward 0
- 同時對「Terminal tasks」(單一 bash tool)和「SWE tasks」(完整 agent harness)做聯合訓練
RLVR 帶來的提升:Terminal-Bench v2 pass@1 +7.9%,SWE-Bench pass@1 +3.0%(均為絕對值)。
關鍵要點
-
跨 Harness 強健性:在 second SFT 中加入 6% 的跨 harness 資料(SWE-Agent、mini-SWE-agent、OpenCode 三種框架),解決代理模型「framework lock-in」問題。單一 harness 訓練在其他 harness 上往往退化,這個設計讓模型能跨框架穩定運作
-
聯合多環境 RL 效果更好:同時對 Terminal tasks 與 SWE tasks 做 RL,效果優於分別訓練,說明不同難度、不同工具設定的訓練信號有互補效果,且 RL 後軌跡更短、無效 tool call 更少
-
MoE 計算效率領先:30B 參數但只啟動 3B,推論成本遠低於同級 dense 模型,對需要自部署代理的團隊有顯著意義
-
開源可商用:Apache 2.0 授權,提供 BF16(
CohereLabs/North-Mini-Code-1.0)與 FP8(CohereLabs/North-Mini-Code-1.0-fp8)兩個版本,支援 OpenCode、Cohere API 或自架 vLLM -
人工評估勝率 66.1%:在程式碼解釋、程式碼編輯、資料視覺化、從零實作四個維度,RLVR 版本整體勝率達 66.1%(vs. 純 SFT checkpoint)
實務應用
本地部署代理工作流:3B 活躍參數意味著在消費級 GPU 或邊緣伺服器上可以合理推論,對需要自部署程式碼代理的團隊吸引力遠高於 Devstral 2(123B)等大型模型。
多框架代理整合:跨 harness 強健性讓它能直接插入不同的代理框架,減少框架遷移成本,適合已有自訂 bash harness 或 OpenCode 整合的工程團隊。
長上下文程式碼理解:128K context window 支援大型程式碼庫的跨文件分析與修改,適合 enterprise 級 coding agent 應用。
延伸觀點
RLVR 的兩個共識
根據 arXiv 上多篇近期研究([arxiv:2603.24202] 與 [arxiv:2508.03501]),RLVR 用於程式碼代理的學術社群已形成兩個核心共識:
Execution feedback 是唯一可靠的 reward signal。讓程式碼實際執行並取得 pass/fail 結果,遠比任何 LLM-as-judge 評分更穩定。North Mini Code 的 unit-test verifier 二元獎勵正是這個路徑的實踐。
Curriculum scheduling 至關重要。純隨機抽題的 RL 訓練效率遠低於有難度遞進設計的訓練。arXiv:2603.24202 提出用 teacher model 迭代精煉題目難度,自然形成「stepping stones」(易→難);North Mini Code 則用兩階段 SFT 先打底,再做 RL,思路相近。
MoE routing 的演化方向
arXiv:2508.19268 提出「Segment-level MoE routing」,讓 expert 自選 top-k 程式碼段落(expert-choice)而非 token 逐一路由,目標是捕捉程式語言的語法結構與上下文模式。North Mini Code 的 128 expert + sigmoid top-k 是標準 token-level 路由的升級版,而 segment-level 路由則指向另一條可能更適合結構化語言的研究路徑。
多輪 RL 的潛力
arXiv:2508.03501 展示了多輪 RL(DAPO 演算法)在 SWE-bench Verified 上讓 Qwen2.5-72B-Instruct 從 11% 提升到 39%(Pass@1),匹敵更大的 dense 模型。North Mini Code 的 SWE-bench pass@1 61.0%(mini-SWE-Agent harness)對比這個起點更高,但兩者共同指向同一結論:多輪 agentic RL 是目前提升程式碼代理效能最有效的路徑,且 MoE 架構與 RLVR 的組合目前尚無充分的學術對比研究,是未來的研究空白。
相關頁面:Mellum2:JetBrains 12B MoE 焦點模型 · Delta Weight Sync in TRL:異步強化學習的百倍同步壓縮 · vLLM V0 升級 V1:強化學習訓練的後端正確性優先原則 · Nemotron-Labs Diffusion:擴散語言模型突破自迴歸推論瓶頸
反向連結
以下頁面引用了本頁: