核心概念

現代大型語言模型本質上是無狀態的——每次對話都是一張白紙。當 AI Agent 執行橫跨數週、數月的長期任務時,這個缺陷會被放大:Agent 要不就得重讀完整的對話歷史(脈絡視窗撐爆、成本暴增),要不就靠 RAG 檢索過去記憶(但 RAG 只抓語義相似的片段,多跳依賴與敘事脈絡容易斷裂)。

Microsoft Research 在 ICML 2026 發表的 Memora 提出了一個根本性解法:將「儲存什麼」與「如何檢索」分離。這個聽起來簡單的原則,背後是一套精心設計的三層記憶表示體系。

為什麼現有方案都不夠好

記憶系統的設計存在一個根本張力:

  • 太具體(如 RAG、Mem0 的碎片化切割):保留細節,但產出孤立條目,失去敘事連貫性,對話的因果關係與時間脈絡碎掉。
  • 太抽象(如圖譜式摘要):壓縮效率高,但摘要過程會剝除邊界條件、數值約束與細粒度細節——Agent 需要精確推理時就抓瞎了。

Memora 稱這個兩難為「抽象-具體性張力(abstraction-specificity tension)」,並主張理論上 RAG 和知識圖譜都是 Memora 框架的特例。

三層記憶結構

第一層:主要抽象(Primary Abstraction) 每筆記憶的「門牌號碼」——一個 6–8 字詞的精煉短語,捕捉記憶核心,並且是唯一被嵌入向量空間用於相似性搜尋的元素。例如:

"Updated Project Orion timeline agreed by Dave and Sarah"

同一主題的新資訊會被合併進現有條目,而非產生新的孤立片段——這是與 RAG 最大的差異。

第二層:記憶值(Memory Value) 完整的豐富內容:原始細節、數字、邊界情況、敘事脈絡——全部保留,但不直接用於向量檢索。透過主要抽象間接存取。

第三層:線索錨點(Cue Anchors) 替代存取路徑,提供靈活的元資料:

  • "Dave Project Orion update"
  • "Project Orion prototype schedule"
  • "Project Orion pilot timeline"

線索錨點不需要預先定義本體論,讓同一筆記憶可以從多個角度被觸及,也能連結語義不相似但語境相關的其他記憶。

主動檢索政策

Memora 的檢索器(Policy-Guided Retriever)採用迭代式主動推理

  1. 從初始查詢出發,逐步精化搜尋方向
  2. 透過線索錨點延伸至「不相似但相關」的記憶
  3. 自行判斷何時停止——不是被動回應單一查詢,而是主動探索

這個設計捕捉了人類回憶中的「多跳依賴」:想到 Dave 的郵件,自然會連結到上週的會議紀錄,再連到原始專案時程。

關鍵要點

  • 記憶條目壓縮:344 筆(Memora)vs 651 筆(Mem0),相同內容量下產生更少但更完整的條目
  • 脈絡符號節省:相比重讀完整歷史,脈絡 token 使用量減少達 98%
  • LoCoMo 基準:LLM 判官準確度 86.3%,超越 RAG、Mem0、Nemori、Zep
  • LongMemEval 基準:準確度 87.4%,同樣領先所有對標方法
  • 多跳推理:在需要跨多個記憶推論的任務上表現最優
  • 論文於 ICML 2026 發表,程式碼開源於 GitHub(microsoft/Memora)

實務應用

多月專案協作:AI 助手能追蹤決策演變,記得「三週前 Dave 同意把 Prototype A 的截止日期延到下季」,而不是每次都要你貼出整份會議紀錄。

研究 Agent 知識累積:跨長期使用累積領域知識,新論文的發現能正確更新(而非重複產生)既有認知。

組織知識管理:跨團隊共享記憶,保留知識的溯源與存取界限——誰說的、在哪個脈絡說的都有跡可查。

後續研究方向(論文揭示)

  • MemLoop:從失敗中自我改進的記憶系統
  • 延遲記憶:推遲記憶構建直到有足夠多的相關資訊佐證
  • 群體記憶:多 Agent 共享知識庫

相關頁面:ChatGPT Dreaming V3:背景記憶合成重構 AI 個人化架構 | MagenticLite:為小型模型優化的代理系統三層架構 | 多代理網絡的湧現風險:Microsoft Research 紅隊測試報告 | AI 委派任務的文件保真度危機:Microsoft Research 深度解析 | AI 作為人類智能的延伸:微軟研究院認知科學視角

延伸觀點

Memora 並非孤例,而是 2025–2026 年 AI Agent 記憶系統研究的縮影。

記憶從工具走向認知:同期 MemCog(arXiv 2605.28046)提出「Memory-as-Cognition」概念——傳統做法把記憶當工具(被動查詢觸發、與推理過程分離),MemCog 則讓記憶探索成為推理過程的一部分,Agent 從對話脈絡主動發起記憶遍歷。Memora 的主動檢索政策走的是類似方向:都拒絕「查一次就停」的被動模型。

多粒度混合成主流:HyMem(arXiv 2602.13933)採用雙層粒度架構——輕量摘要處理簡單查詢,深層 LLM 模組配備反思機制處理複雜查詢,動態排程靈感來自認知經濟學,在 LoCoMo 上同樣達成 92.6% 計算成本削減。Memora 的主要抽象 + 記憶值分層,與 HyMem 的多粒度設計殊途同歸:不同查詢複雜度對應不同存取路徑

共識結論:多篇 2026 年論文一致指向同一個方向——純 RAG 不夠,純摘要也不夠,長期 Agent 記憶的可行解必須在「壓縮效率」與「細節保真」之間找到動態平衡。Memora 給了一個可量化的答案:98% token 節省,同時準確率還超過全脈絡方案。

反向連結

以下頁面引用了本頁: