共 31 篇文章包含此標籤
傳統幻覺評測多把回答視為單一輸出,判斷它是否正確;但 Agent 是規劃、檢索、推理、呼叫工具再回覆的連續軌跡。中間某一
工具型 LLM Agent 不只回答問題,還會搜尋、寫程式、讀取環境資訊並連續採取動作;這也讓它有機會不解決任務本身,卻
藥物資產盡職調查的第一關,是針對特定適應症找出所有具競爭關係的藥物,並整理別名、作用機制、標的、研發階段、監管狀態與公司
Model Context Protocol(MCP)正在成為 LLM Agent 與外部工具溝通的標準介面——從資料庫
AgentClinic 是評估「會使用工具的臨床 AI agent」的多模態基準。它不把醫療能力簡化為單題問答,而是模擬
LLM 代理面臨一個根本性瓶頸:上下文視窗有限,而現實任務往往跨越長時程、需要跨步驟記憶。當前主流做法將長期記憶(LTM
Wang 等人以 PRISMA 2020 流程進行系統性回顧與統合分析,比較「人類專業者加上大型語言模型」(H+AI)與
Lumer 等人(2026)的調查論文,聚焦於 LLM Agent 在**生產環境**裡如何挑選外部工具與協作代理。論文
大型語言模型(LLM)正逐漸被採用為自主無人機(UAV)任務的高層控制器。然而現有評估框架存在一個根本性缺口:很少有研究
DeepPlanning 是由 Yinger Zhang 等九位作者提出的智能體規劃基準測試,發表於 2026 年 1
大型語言模型(LLM)在推理能力上取得了令人矚目的進展,卻依然在看似簡單的場景中出現失敗。Peiyang Song、Pe
**論文資訊**