核心概念

當 AI 研究代理(deep-research agent)同時存取本地私密文件與公開網路時,會產生一種隱性洩漏風險——即使每條網路查詢看起來都無害,觀察者透過彙整查詢記錄就能重建出企業機密。

ServiceNow 研究團隊將這種現象命名為 Mosaic Effect(馬賽克效應),並發布 MosaicLeaks 基準測試,系統性地量化和解決這個問題。

馬賽克效應如何運作

以一個假設的醫療雲端公司 MediConn 為例:

  1. 本地查詢 1:MediConn 基礎設施在 Q1 2025 完成雲端遷移的百分比?→ 70%
  2. 本地查詢 2:70% 里程碑在哪個月達成?→ 一月
  3. 網路查詢:哪家科技公司在 2024 年一月揭露了國家級駭客攻擊?→ Microsoft

三條查詢各自獨立看起來毫無問題。但觀察代理查詢記錄的對手,可以重建出一個原本應保密的事實:MediConn 於 2025 年 1 月完成 70% 雲端遷移里程碑

三種洩漏類型

洩漏類型 對手能看到的資訊 構成洩漏的條件
意圖洩漏(Intent Leakage) 僅查詢記錄 可推斷代理正在回答哪些私密問題
答案洩漏(Answer Leakage) 查詢記錄 + 特定私密問題 能從查詢記錄推斷出答案
完整資訊洩漏(Full-Info Leakage) 僅查詢記錄 能主動陳述可驗證的私密事實

關鍵要點

MosaicLeaks 基準測試

  • 1,001 條多跳研究鏈,跨越本地企業文件與受控公開語料庫
  • 訓練 559 條、驗證 98 條、測試 344 條
  • 企業文件來自 DRBench 風格任務,網路文件來自 BrowseComp-Plus
  • 代理有四個工具:Plan(規劃查詢)、Choose(選擇文件)、Read(嘗試作答)、Resolve(決定下一步)

提示詞無效

在 Qwen3-4B 上加入隱私保護指令:

  • 答案/完整資訊洩漏:34.0% → 25.5%(微幅改善)
  • 嚴格鏈成功率:48.7% → 44.5%(效能下滑
  • 行為改變僅是「減少網路查詢」,而非「構建更安全的查詢」

結論:提示詞無法訓練出隱私意識,只能訓練出來。

任務導向訓練反效果

只針對任務效能做強化學習訓練:

  • 嚴格鏈成功率:48.7% → 59.3% ✓(進步)
  • 答案/完整資訊洩漏:34.0% → 51.7% ✗(惡化)

代理學會把更多上下文資訊塞進查詢以幫助文件檢索,意外地讓敏感細節更容易暴露。

PA-DR:兼顧任務與隱私的訓練方法

Privacy-Aware Deep Research(PA-DR) 結合兩個獎勵訊號:

1. 情境化任務獎勵(Situational Task Reward) 不對完整軌跡統一打分,而是針對同一步驟、同一跳、同等可用資訊的模型呼叫相互比較:

  • Plan 呼叫:獎勵搜尋正確來源並檢索到正確文件
  • Choose 呼叫:獎勵選到含有答案的文件
  • 精準的功勞歸屬,無需額外訓練 Value Model

2. 學習式隱私獎勵(Learned Privacy Reward) 用一個 Qwen3-4B 分類器評估每條網路查詢的風險:

  • 直接私密資訊洩漏風險
  • 馬賽克洩漏風險(加入現有查詢記錄後新增的洩漏)
  • PA-DR 懲罰較高的風險,確保隱私成本落在造成洩漏的規劃決策上

PA-DR 實驗結果

方法 嚴格鏈成功率 答案/完整資訊洩漏
基線 Qwen3-4B 48.7% 34.0%
僅任務 RL 59.3% 51.7%
任務 + PA-DR 58.7% 9.9%

PA-DR 保留了任務訓練 71% 的效能增益,同時將洩漏率從 51.7% 降至 9.9%,低於基線的 34.0%

PA-DR 代理不是減少查詢次數,而是發出更多網路查詢,但會主動移除:具體數值(如「15%」、百分比)、時間識別詞(如「2024」、月份)、答案類型線索——仍然能定位到正確的公開文件。


實務應用

對 AI Agent 開發者的啟示:

  1. 預設假設查詢記錄會被看到:企業部署研究代理時,任何能觀察到 API 呼叫記錄的環節(雲端供應商、網路監控、日誌系統)都是潛在的洩漏面。

  2. 隱私需要訓練,不能靠系統提示詞:系統提示詞可以影響代理的表面行為,但無法改變它如何在查詢中編碼資訊的底層模式。參見 AI Agent 生產環境防線:最小權限與稽核控制 的最小授權原則——同樣的邏輯適用於查詢設計。

  3. 評估代理時要測試查詢記錄,不只測試最終答案:傳統評估只看代理是否答對,MosaicLeaks 提醒我們還需要審計代理的查詢軌跡本身。

  4. 情境化訓練獎勵的樣本效率優勢:傳統 Outcome-only 獎勵需要 963k 樣本才能達到 55% 成功率,情境化獎勵只需 146k——約 6 倍效率提升,對資源有限的企業具有直接成本意義。

關聯討論:


延伸觀點

MosaicLeaks 揭示的問題超出資訊安全的傳統邊界:它不是代理「說錯話」,而是代理正確地完成任務時的副作用。這對 AI 治理有深遠意義:

對齊困境的新面向:現有的 RLHF 對齊主要訓練模型不說有害內容,但 MosaicLeaks 顯示,訓練效能本身就可能誘發隱私危害——模型越聰明地檢索,越善於在查詢中編碼語境。這與 Natural Language Autoencoders:解讀 Claude 的未說出口 的觀察一致:模型在輸出中攜帶的隱性語義資訊是可測量的。

企業 AI 風險地圖的空白:當前企業 AI 安全框架(如 AI Agent 生產環境防線:最小權限與稽核控制)聚焦於代理的行動(是否刪除了不該刪的資料、是否存取了未授權系統),MosaicLeaks 指出還需要審計代理的查詢行為——這在傳統安全框架中幾乎是盲點。

可訓練性是好消息:儘管問題真實存在,PA-DR 的結果表明這個問題在原則上是可以被系統性解決的,且無需犧牲核心任務效能。這對企業評估是否能安全部署研究代理提供了一條可行路徑。

MosaicLeaks 目前仍是受控基準,僅涵蓋三個公司情境、固定語料庫、單一代理架構。在開放式研究、多代理協作、或查詢記錄本身有隱私保護的情境下,結論是否仍然成立,有待進一步研究。

反向連結

以下頁面引用了本頁: