核心概念

傳統幻覺研究聚焦在「單輪回答是否正確」,但 LLM Agent 的實際運作是多步驟序列推理。若第三步產生了幻覺,這個錯誤會沿著後續步驟傳遞、放大,最終導致整個任務失敗——而現有工具無法告訴你問題出在哪一步。

AgentHallu(Xuannan Liu 等人,2026-01,arXiv 2601.06818)正是為了填補這個缺口:它定義了「Agent 幻覺歸因(Hallucination Attribution)」這個新研究任務,要求模型不只指出「這個任務失敗了」,而是回答:哪一步出了問題?為什麼?

基準測試規模

項目 數據
軌跡(trajectories)數量 693 條高品質序列
涵蓋 Agent 框架 7 種
涵蓋應用領域 5 個
測試模型數量 13 個 SOTA 模型

每條軌跡包含三層標注:二元標籤(有/無幻覺)、責任步驟定位、因果解釋。

幻覺五分類法(含 14 個子類別)

類別 核心問題
Planning 規劃階段目標設定錯誤或步驟遺漏
Retrieval 檢索到不相關或失真的資訊
Reasoning 推理過程中的邏輯跳躍或數學錯誤(含 Fact Derive、Math Reasoning)
Human-Interaction 處理使用者輸入時的誤解或錯誤假設(含 Query Misalign、Incorrect Argument)
Tool-Use 工具呼叫參數錯誤或輸出誤解

關鍵要點

  • 最佳模型步驟定位準確率僅 41.1%:即使是 GPT-5、Gemini-2.5 Pro 等頂尖模型,在步驟定位上依然有明顯瓶頸,顯示此任務目前超越現有模型能力上限
  • 工具呼叫幻覺最難診斷(11.6%):Tool-Use 類幻覺準確率遠低於其他類別,因工具輸出通常無法被模型二次驗證,使幻覺難以被內部推理察覺
  • 幻覺的傳播性(Propagation)是 Agent 特有問題:單步驟的錯誤會被後續步驟「採信」並放大,這在單輪 QA 中不存在;多步驟系統的脆弱性來源不只是「模型不夠聰明」,更是架構性的錯誤傳遞
  • 現有評估範式的盲點:現行 Agent 評估只看最終輸出是否正確,導致「輸出幸運正確但中間步驟已產生幻覺」的情況被漏掉;這讓系統看起來比實際更可靠
  • 標注難度高:幻覺的主觀性很高,相關研究顯示人類標注者之間 inter-annotator Cohen's κ 僅 0.456,說明分類框架的標準化是當前最迫切的研究課題

實務應用

對於正在建構 LLM Agent 系統的開發者,AgentHallu 的意義在於:

選擇框架時需考慮幻覺發生率:7 種 Agent 框架在幻覺分布上差異顯著,某些架構在工具呼叫步驟更容易出錯。

日誌設計應保留完整軌跡:只記錄最終輸出的系統無法做事後歸因。中間步驟的推理過程需要結構化保存,這也是 DeepPlanning:長程智能體規劃基準測試 強調的同一方向。

工具呼叫需要額外驗證機制:11.6% 的定位準確率意味著模型本身無法可靠地自我診斷工具使用錯誤,外部驗證是必要設計。參見 AI Agent 生產環境防線:最小權限與稽核控制 的生產實踐。

相關研究:LLM推理失敗:首個全面分類調查框架 | Agentic Memory:LLM Agent 長短期記憶統一管理框架 | LLM Agent 工具與代理選擇:生產環境全景調查

延伸觀點

三篇 2026 年的後續研究(Trajel 2026-05、DRIFT/TELBench 2026-06、MARCH 2026-03)為 AgentHallu 的發現提供多角度補充,以下兩個觀點獲跨論文驗證:

步驟級診斷比最終答案評估更有價值:DRIFT 框架以 1,000 個標注錯誤片段驗證,以 claim 為單位追蹤 agent 軌跡,可比傳統 baseline 提升最多 30 個百分點的錯誤定位準確率。Trajel 的多標籤標注也顯示,68.3% 的幻覺軌跡包含多種類型幻覺,單一分類體系會掩蓋問題的複雜性。兩篇論文都指向同一結論:評估 Agent 必須拆解中間步驟,不能只看輸出。

執行時訊號(Runtime Signals)比事後分類器更有效:Trajel 最反直覺的發現是不需要訓練複雜分類器,只要在執行時收集「清晰度與理由可信度(clarity-and-justification)」訊號就能達到 AUC=0.908,遠超所有監督式分類器。若該訊號與結果驗證同時失敗,幻覺發生概率高達 97.1%——這意味著可以為生產環境的 Agent 建立即時熔斷機制,而非只做事後分析。

驗證設計需要資訊不對稱(單篇高品質來源,arxiv.org):MARCH 提出讓「驗證 agent 看不到原始推理過程」的資訊隔離設計,打破自我確認偏誤(self-confirmation bias)。8B 參數模型在此架構下達到媲美大模型的幻覺減少率,是 AgentHallu 所揭示問題的一個可行解法方向。

反向連結

以下頁面引用了本頁: