核心概念

DeepPlanning 是由 Yinger Zhang 等九位作者提出的智能體規劃基準測試,發表於 2026 年 1 月(arXiv:2601.18137)。

當前智能體評估(Agent Evaluation)的主流基準普遍存在一個盲點:過度強調步驟層級的局部推理(local, step-level reasoning),而忽略現實任務中真正困難的部分——全局約束最佳化(global constrained optimization)。所謂全局約束,指的是在完成整個任務的過程中,同時滿足時間預算、金錢預算、偏好限制等跨步驟的總體條件。

DeepPlanning 針對這個盲點,設計了兩類長程任務:

  1. 多日旅行規劃(Multi-day Travel Planning):要求智能體在有限預算內,跨越多天安排行程、交通、住宿,同時滿足使用者偏好限制。這類任務要求智能體主動搜集資訊(如票價、餐廳評分)、處理細粒度的局部限制(如「必須晚 7 點前到達」),並讓整個行程符合總預算。

  2. 多商品購物規劃(Multi-product Shopping):要求智能體在金錢與數量限制下,從大量選項中找出最優組合。這不是簡單的最低價選擇,而是在滿足品質、品牌、交貨期等複合條件下的最佳化問題。

這兩類任務共同測試三個核心能力:

  • 主動資訊獲取(Proactive Information Acquisition):主動搜尋並驗證所需資訊,而非依賴已知知識
  • 局部約束推理(Fine-grained Local Constraints):處理每個子任務的具體限制
  • 全局約束最佳化(Global Constrained Optimization):確保所有局部決策加總後仍符合全局目標

基準的結構性貢獻

DeepPlanning 與現有基準的本質差異在於:現有基準(如 WebArena、AgentBench)多以可驗證的步驟完成率為評分標準,而 DeepPlanning 的評估核心是最終方案是否同時滿足所有可驗證約束。這更貼近真實世界的使用者需求——使用者在意的是最終行程是否符合預算,而不是智能體執行了幾個步驟。


關鍵要點

  • 前沿 LLM 均告失敗:評估結果顯示,即使是最強大的前沿智能體 LLM,在長程規劃任務中的表現也明顯不足——說明現有模型的局部推理能力並不等同於真正的規劃能力。

  • 需要顯式推理 + 平行工具呼叫:表現較好的策略有兩個共同特徵:(1)可靠的顯式推理模式——模型能清楚列出約束並追蹤滿足狀態;(2)平行工具呼叫——同時發出多個查詢以提高效率與效能的取捨。

  • 現有基準的系統性低估:多數現有基準因偏重步驟推理,使得模型在基準上表現良好,卻在真實複雜任務中失敗。DeepPlanning 揭示了這個評估缺口。

  • 全局約束是真正的難點:局部推理(「下一步應該做什麼」)與全局最佳化(「所有決策加總是否符合預算」)是兩個不同的認知挑戰。現有模型擅長前者,但在後者上大幅落後。

  • 開源資料與代碼:作者公開了完整資料集與評估代碼,為後續長程規劃研究提供可複現的基準。


實務應用

對 AI Agent 應用開發者而言,DeepPlanning 的發現有直接的工程意義。

設計含全局預算追蹤的規劃 Agent 時,應考慮:

  • 在 system prompt 中明確要求模型追蹤已使用的預算餘額
  • 採用工具呼叫的平行批量查詢,減少序列等待
  • 設置顯式的約束驗證步驟,在最終輸出前確認所有限制均已滿足

這個發現與 AI Agent 設計模式 中的「計劃-執行-驗證」迴圈設計原則一致:長程任務需要比短程問答更強的全局狀態管理能力。研究結果也呼應 Agentic AI 企業落地現實:基礎建設障礙與突破策略 的觀察——企業部署 AI Agent 最大的障礙往往不是模型能力本身,而是多步驟任務的約束滿足與狀態追蹤。

相關基準建設工作可對照 MCP-Atlas:大規模 MCP 真實伺服器工具使用能力基準測試LLM Agent 工具與代理選擇:生產環境全景調查——三者共同勾勒出 2026 年智能體能力評估的研究前沿:從工具使用、代理選擇,到長程規劃,評估體系正逐漸向真實任務複雜度靠攏。


延伸觀點

DeepPlanning 的核心發現並非孤立案例,而是 2025-2026 年長程規劃研究領域的共識。

前沿模型的規劃能力缺口已是跨基準共識。COMPASS(arXiv:2510.07043)在旅行規劃場景下測試多個最強模型,發現雖然「可行性」(硬性約束滿足率)達 70-90%,但「最優性」(達成用戶目標)僅 20-60%。GroupTravelBench(arXiv:2605.25200)更嚴格——多人旅行規劃中,最強智能體的計畫有效率低於 12%。兩篇論文與 DeepPlanning 同時指向一個結論:現有模型能通過局部推理測試,但在全局約束滿足上系統性失敗。

瓶頸不在工具,在探索廣度。COMPASS 明確排除了「工具呼叫能力不足」的假設,指出真正的瓶頸是對解決方案空間的探索深度不足——模型傾向於過早收斂到局部可行解,而不是探索更廣的選項後再最佳化。這與 DeepPlanning 強調「平行工具呼叫」的必要性一致:平行呼叫不只是效率問題,也是讓模型獲得足夠資訊以做出全局最優決策的前提。

規模擴張不能解決長程規劃問題。UltraHorizon(arXiv:2509.21766)將任務延伸至 200k+ token、400+ 工具呼叫的超長程情境,發現簡單的規模擴大無法改善效能,並識別出兩類根本缺陷:上下文鎖定(模型在長任務中固著於早期決策)與核心能力缺口。這暗示長程規劃能力需要架構層面的解決方案,而非單純的模型放大。

反向連結

以下頁面引用了本頁: