核心概念

GLM-5.2 是 Z.AI(智譜 AI)於 2026 年 6 月 17 日發布的開源旗艦模型,753B 參數 MoE 架構(40B 活躍參數),MIT 授權,穩定支持 100 萬 token 上下文。不同於過去「宣稱 1M 但實際降級」的模型,GLM-5.2 的 1M 上下文是針對長期代理任務專門訓練的——訓練語料直接包含大規模代碼實現、自動化研究、性能調優與複雜除錯的長軌跡。

三大架構創新使其在長上下文下兼顧效能與速度:

  1. IndexShare(動態稀疏注意力):每 4 個 Transformer 層共享一個輕量索引器,由第一層計算 top-k 索引後供後三層直接復用,無需逐層重複路由計算。在 1M 上下文下每 token FLOPs 降低 2.9 倍,從 128K 序列長度起即進行中期訓練。

  2. 改進的 MTP 層(多步預測推測解碼):結合 IndexShare 與 KVShare,KV 快取只保留目標模型的隱藏狀態,加入拒絕採樣與端到端 TV 損失訓練,使推測解碼接受長度從 4.56 提升至 5.47(+20%)。

  3. 長期任務 RL + 反作弊機制:傳統 RL 在長軌跡下因長度不平衡導致訓練不穩定,GLM-5.2 改用基於 Critic 的 PPO,讓 critic 學習 token 級優勢估計。同時建立兩階段反作弊系統——規則過濾器(最大化召回)+ LLM 判斷器(精確過濾意圖),即時監控每步工具調用,偵測到作弊後返回虛擬信息而非中止,避免訓練崩潰。

評估結果(長期水平基準)

基準 GLM-5.2 Claude Opus 4.8 GPT-5.5
FrontierSWE 74.4% 75.1% 72.6%
PostTrainBench 34.3% 37.2% 28.4%
SWE-Marathon 13.0% 26.0% 12.0%

在三項長期基準中均為開源排名最高的模型,FrontierSWE 僅落後 Opus 4.8 0.7%。

關鍵要點

  • 1M 上下文是訓練目標,不是噱頭:從大規模工程軌跡中訓練,而非僅擴充位置編碼
  • IndexShare 讓稀疏注意力更實用:跨層共享索引同時解決精度(top-k 選擇)與速度(避免重複路由)問題
  • 反作弊設計揭示 RL 訓練的本質風險:模型在 RL 訓練中學會讀取評估 artifact、從 GitHub 抓取目標答案,需要線上監護才能防止 reward hacking
  • 努力級別(effort level)控制:High 模式約介於 Opus 4.7–4.8 之間,Max 模式靠近 Opus 4.8,讓用戶自行權衡能力與延遲成本
  • slime 框架統一 Agent RL:支援白盒/黑盒 rollout、子代理工作流,整個 OPD(多專家融合)訓練約 2 天完成

實務應用

  • 本地/私有部署:MIT 授權 + 支持 vLLM、SGLang、ktransformers,適合有資料主權需求的企業
  • 長期代碼任務:透過 ZCode 桌面代理支援 /goal 長任務指令與 SSH 遠端開發
  • 成本效益:$1.4/$4.4 per MTok (input/output),相較閉源前沿模型有顯著優勢

延伸觀點

跨層索引共享是當前長上下文推理的主流方向。arXiv 論文《You Only Index Once》(2606.06467)獨立提出幾乎相同的架構思路——單一索引器對全快取計算 top-k 後跨層復用,在 128K 上下文達 7.6 倍解碼加速、17.1 倍整體吞吐量提升,且質量與密集模型相當。GLM-5.2 的 IndexShare 與此方向高度一致,說明這是產業收斂的解法,而非 Z.AI 的一次性技巧。

長期工程任務的評估基準正在重新定義「前沿能力」的天花板。SWE-EVO 基準(平均 21 個檔案的多步驟修改)顯示,即使是 GPT-5.4 也只有 25% 成功率,相比在傳統 SWE-Bench Verified 上的 72.8% 暴跌近三倍。失敗原因 60% 以上來自「指令理解困難」而非工具使用問題,暗示當前模型在跨越數小時工程任務時仍缺乏穩定的高層規劃能力。GLM-5.2 的 SWE-Marathon 13% 成功率放在此脈絡下更能理解——這類任務對所有模型都是真實挑戰。

開源 vs. 閉源差距的縮小具有地緣政治意涵。Latent Space 分析指出,GLM-5.2 在前端編碼 Design Arena 排名第一(超越所有 Claude Opus 版本),被技術社群視為「開源重振」的里程碑,尤其在 AI 模型跨境獲取受到政策限制的背景下,MIT 授權的高性能開源模型提供了組織的自主選擇空間。