核心貢獻:把「答錯了嗎」拆成「從哪一步開始歪掉」

傳統幻覺評測多把回答視為單一輸出,判斷它是否正確;但 Agent 是規劃、檢索、推理、呼叫工具再回覆的連續軌跡。中間某一步若把地名、工具參數或檢索結果對錯,後續步驟可能把錯誤當前提繼續推演,最後才在答案端爆炸。AgentHallu 因此提出「自動幻覺歸因」任務:除了判定是否有幻覺,還要定位造成首次偏離的責任步驟(where),並以自然語言解釋其原因(why)。

論文收集 693 條高品質 Agent 軌跡,平均 7.6 步,覆蓋 7 種常見 Agent 框架與世界知識、科學、數學、一般助理、工具使用五個領域。資料經三階段篩選,排除不具診斷意義的失敗、過短序列及過於簡單的案例;每條資料都有幻覺二元標籤、責任步驟標註及人工撰寫的原因說明。

方法論亮點

研究以紮根理論建立五大類、14 個細分類的 taxonomy:規劃(目標或步驟設計錯誤)、檢索(取得不相關或失真資訊)、推理(邏輯與計算錯誤)、人機互動(誤解使用者問題或參數)與 工具使用(呼叫或解讀工具輸出失誤)。它同時以「責任步驟定位準確率」評估 where,以 G-EVAL 評估 why 的解釋品質;這比只看最終任務成功率更接近除錯時真正需要的訊號。

13 個前沿模型的結果不算客氣:最佳模型 Gemini-2.5-Pro 的責任步驟定位準確率僅 41.1%,在工具使用幻覺上更降至 11.6%。逐步提示可提升歸因,但要付出更多 token;軌跡越長,定位越難,GPT-5 在不超過五步時為 40.3%,十一個步驟以上則降至 23.9%。這些數字是該基準上的測量結果,不應直接外推為所有 Agent 的實際失敗率。

對實務的意義

部署端不該只保留最終回答和成功/失敗旗標;應保存可搜尋、可比對的結構化軌跡:任務意圖、計畫版本、檢索證據、工具輸入輸出、驗證結果與人工接手點。如此一來,錯誤才能被定位至可修復的元件,而非籠統歸咎「模型幻覺」。尤其工具步驟不能依賴模型自我檢查,應配合型別/範圍檢查、獨立資料源、可重跑測試與高風險動作前的人類核准。

這也補足 DeepPlanning:長程智能體規劃基準測試 對長軌跡規劃能力的測量,以及 MCP-Atlas:大規模 MCP 真實伺服器工具使用能力基準測試 對真實工具調用的驗收;若系統在最終結果失敗,AgentHallu 提供的是反查「哪個環節先錯」的評估語言。落地原則則可對照 AI Agent 生產環境防線:最小權限與稽核控制:將可觀測性、最小權限與獨立驗證視為 Agent 架構的一部分,而不是事後補丁。

限制與後續問題

基準雖跨多種框架與領域,仍由特定資料來源、代理實作與人工標註決定其覆蓋範圍;「最初責任步驟」在多重錯誤互相影響時也可能有判讀空間。後續工作應測試跨框架遷移、線上執行期監控,以及歸因結果是否真的能縮短修復時間、降低重犯率。重點不是替 Agent 頒發一張「不會幻覺」的證書,而是建立能讓錯誤露出來、被追到、被修掉的工程閉環。

來源

  • Liu, X.-N. et al. (2026). AgentHallu: Benchmarking Automated Hallucination Attribution of LLM-based Agents. arXiv:2601.06818。
  • 原始頁面摘錄:raw/articles/2026-09-28-agenthallu-llm-agent-hallucination-attribution。

反向連結

以下頁面引用了本頁: