核心概念
當 AI 研究代理(deep-research agent)同時存取本地私密文件與公開網路時,會產生一種隱性洩漏風險——即使每條網路查詢看起來都無害,觀察者透過彙整查詢記錄就能重建出企業機密。
ServiceNow 研究團隊將這種現象命名為 Mosaic Effect(馬賽克效應),並發布 MosaicLeaks 基準測試,系統性地量化和解決這個問題。
馬賽克效應如何運作
以一個假設的醫療雲端公司 MediConn 為例:
- 本地查詢 1:MediConn 基礎設施在 Q1 2025 完成雲端遷移的百分比?→ 70%
- 本地查詢 2:70% 里程碑在哪個月達成?→ 一月
- 網路查詢:哪家科技公司在 2024 年一月揭露了國家級駭客攻擊?→ Microsoft
三條查詢各自獨立看起來毫無問題。但觀察代理查詢記錄的對手,可以重建出一個原本應保密的事實:MediConn 於 2025 年 1 月完成 70% 雲端遷移里程碑。
三種洩漏類型
| 洩漏類型 | 對手能看到的資訊 | 構成洩漏的條件 |
|---|---|---|
| 意圖洩漏(Intent Leakage) | 僅查詢記錄 | 可推斷代理正在回答哪些私密問題 |
| 答案洩漏(Answer Leakage) | 查詢記錄 + 特定私密問題 | 能從查詢記錄推斷出答案 |
| 完整資訊洩漏(Full-Info Leakage) | 僅查詢記錄 | 能主動陳述可驗證的私密事實 |
關鍵要點
MosaicLeaks 基準測試
- 1,001 條多跳研究鏈,跨越本地企業文件與受控公開語料庫
- 訓練 559 條、驗證 98 條、測試 344 條
- 企業文件來自 DRBench 風格任務,網路文件來自 BrowseComp-Plus
- 代理有四個工具:Plan(規劃查詢)、Choose(選擇文件)、Read(嘗試作答)、Resolve(決定下一步)
提示詞無效
在 Qwen3-4B 上加入隱私保護指令:
- 答案/完整資訊洩漏:34.0% → 25.5%(微幅改善)
- 嚴格鏈成功率:48.7% → 44.5%(效能下滑)
- 行為改變僅是「減少網路查詢」,而非「構建更安全的查詢」
結論:提示詞無法訓練出隱私意識,只能訓練出來。
任務導向訓練反效果
只針對任務效能做強化學習訓練:
- 嚴格鏈成功率:48.7% → 59.3% ✓(進步)
- 答案/完整資訊洩漏:34.0% → 51.7% ✗(惡化)
代理學會把更多上下文資訊塞進查詢以幫助文件檢索,意外地讓敏感細節更容易暴露。
PA-DR:兼顧任務與隱私的訓練方法
Privacy-Aware Deep Research(PA-DR) 結合兩個獎勵訊號:
1. 情境化任務獎勵(Situational Task Reward) 不對完整軌跡統一打分,而是針對同一步驟、同一跳、同等可用資訊的模型呼叫相互比較:
- Plan 呼叫:獎勵搜尋正確來源並檢索到正確文件
- Choose 呼叫:獎勵選到含有答案的文件
- 精準的功勞歸屬,無需額外訓練 Value Model
2. 學習式隱私獎勵(Learned Privacy Reward) 用一個 Qwen3-4B 分類器評估每條網路查詢的風險:
- 直接私密資訊洩漏風險
- 馬賽克洩漏風險(加入現有查詢記錄後新增的洩漏)
- PA-DR 懲罰較高的風險,確保隱私成本落在造成洩漏的規劃決策上
PA-DR 實驗結果
| 方法 | 嚴格鏈成功率 | 答案/完整資訊洩漏 |
|---|---|---|
| 基線 Qwen3-4B | 48.7% | 34.0% |
| 僅任務 RL | 59.3% | 51.7% |
| 任務 + PA-DR | 58.7% | 9.9% |
PA-DR 保留了任務訓練 71% 的效能增益,同時將洩漏率從 51.7% 降至 9.9%,低於基線的 34.0%。
PA-DR 代理不是減少查詢次數,而是發出更多網路查詢,但會主動移除:具體數值(如「15%」、百分比)、時間識別詞(如「2024」、月份)、答案類型線索——仍然能定位到正確的公開文件。
實務應用
對 AI Agent 開發者的啟示:
-
預設假設查詢記錄會被看到:企業部署研究代理時,任何能觀察到 API 呼叫記錄的環節(雲端供應商、網路監控、日誌系統)都是潛在的洩漏面。
-
隱私需要訓練,不能靠系統提示詞:系統提示詞可以影響代理的表面行為,但無法改變它如何在查詢中編碼資訊的底層模式。參見 AI Agent 生產環境防線:最小權限與稽核控制 的最小授權原則——同樣的邏輯適用於查詢設計。
-
評估代理時要測試查詢記錄,不只測試最終答案:傳統評估只看代理是否答對,MosaicLeaks 提醒我們還需要審計代理的查詢軌跡本身。
-
情境化訓練獎勵的樣本效率優勢:傳統 Outcome-only 獎勵需要 963k 樣本才能達到 55% 成功率,情境化獎勵只需 146k——約 6 倍效率提升,對資源有限的企業具有直接成本意義。
關聯討論:
- ChatGPT 如何在保護隱私的同時持續學習:同樣探討 AI 系統如何在學習能力與隱私保護之間取得平衡
- Google DeepMind 聯合資助多Agent安全研究:千萬美元對抗湧現風險:多代理系統的安全問題已引起頂尖機構的系統性投入
- Natural Language Autoencoders:解讀 Claude 的未說出口:AI 模型在輸出中編碼的資訊量往往超出預期
延伸觀點
MosaicLeaks 揭示的問題超出資訊安全的傳統邊界:它不是代理「說錯話」,而是代理正確地完成任務時的副作用。這對 AI 治理有深遠意義:
對齊困境的新面向:現有的 RLHF 對齊主要訓練模型不說有害內容,但 MosaicLeaks 顯示,訓練效能本身就可能誘發隱私危害——模型越聰明地檢索,越善於在查詢中編碼語境。這與 Natural Language Autoencoders:解讀 Claude 的未說出口 的觀察一致:模型在輸出中攜帶的隱性語義資訊是可測量的。
企業 AI 風險地圖的空白:當前企業 AI 安全框架(如 AI Agent 生產環境防線:最小權限與稽核控制)聚焦於代理的行動(是否刪除了不該刪的資料、是否存取了未授權系統),MosaicLeaks 指出還需要審計代理的查詢行為——這在傳統安全框架中幾乎是盲點。
可訓練性是好消息:儘管問題真實存在,PA-DR 的結果表明這個問題在原則上是可以被系統性解決的,且無需犧牲核心任務效能。這對企業評估是否能安全部署研究代理提供了一條可行路徑。
MosaicLeaks 目前仍是受控基準,僅涵蓋三個公司情境、固定語料庫、單一代理架構。在開放式研究、多代理協作、或查詢記錄本身有隱私保護的情境下,結論是否仍然成立,有待進一步研究。
反向連結
以下頁面引用了本頁: