核心觀點
OpenAI 的案例研究指出,法律與專業服務平台 Legora 以 GPT-6 Astra 執行財務報表「勾稽」(tie-out):將草擬財報逐項比對試算表、合併明細與前一年帳目,確認每一筆金額能否相互對應。此類工作原本可能耗費一個晚上甚至數天;Legora 表示,代理人在一次執行中於數分鐘內讀完 41 份文件、記錄每項核對結果,並找出預先植入的 4 個錯誤。
重點不是讓模型替簽核人做財務或法律判斷,而是把「逐項找資料、對數字、留下查核軌跡」這段高耗時的第一輪工作交給代理。專業人員仍需判斷差異是否合理、是否需要更正,以及能否對外定稿。這個分工與 財務團隊 × Codex:五大財務文件自動化場景 的方向一致:AI 加速資料組裝與例外浮現,人類保留脈絡判讀與責任。
技術亮點:把完整性變成可審閱的輸出
Legora 將這個流程放在其 Legora Benchmark for Agentic Reasoning(BAR)評估中。依該公司自述,GPT-6 Astra 相較前一代模型,在此財報工作流的表現提升接近 40%;跨 BAR 全部任務的平均改善則約 3%。兩個數字不能直接當作跨產品的通用基準,因為它們由案例方的內部評估定義;但它們指出一個較可操作的能力邊界:代理可同時處理大量異質文件,逐筆回填「查了什麼、對到什麼、哪裡不一致」。
案例中特別提到一筆藏在營收附註中的 50 萬英鎊缺口。價值不只在抓到異常,而是讓每個餘額都有對應的支持性文件與核對紀錄。對受監管或可稽核的流程而言,沒有可回溯證據的「看似正確」遠遠不夠;可追蹤的核對清單才讓專家能有效覆核、抽查與承擔最終責任。
實務意義:先選規則清楚、可驗證的窄流程
這個案例適合應用在審計、稅務、法遵與風險管理等工作,但導入時應先把任務限定為「比對與例外報告」,而不是直接授權模型改帳或做合規結論。可先定義三層控制:第一,明確指定可讀取的來源與版本;第二,以金額、科目、期間等確定性規則驗證;第三,讓具資格的人員審核每個例外與最後輸出。
這與 自改善稅務代理:Codex eval 迴圈將準確率從 25% 提升至 97% 的經驗互補:前者示範高文件量下的完整勾稽,後者強調把實務修正轉成可重複執行的評估。兩者共同說明,可靠的專業代理不是只追求一次回答更像人,而是必須留下可測試、可覆核、可持續改善的工作軌跡。
導入判讀
Legora 的案例可作為「人類在迴路中」的務實模板:把大量核對交給代理,將專家的注意力集中在高風險差異與最終判斷。評估成效時,除了速度與錯誤發現率,還應追蹤例外的誤報/漏報、人工覆核時間、查核紀錄完整度,以及更正後是否產生回歸錯誤。AI 可以把 41 份文件變成一份待審清單;但那份清單是否足以支持專業決策,仍要由流程設計與人類責任來保證。
相關連結
反向連結
以下頁面引用了本頁:
- OpenAI × PwC:AI Agent 重塑 CFO 辦公室(文章精選)
- Playco × GPT-6 Astra:從灰盒到可玩原型的代理式遊戲開發(文章精選)
- 自改善稅務代理:Codex eval 迴圈將準確率從 25% 提升至 97%(文章精選)
- 財務團隊 × Codex:五大財務文件自動化場景(文章精選)
- GPT-6 Astra:新一代智慧、電腦操作與負責任部署(文章精選)
- Gilbert + Tobin × OpenAI:法律服務業的治理式 AI 規模化(文章精選)
- Astra for Law:法律專業的檢索、治理與可組合工作流(文章精選)
- Harvey × GPT-6 Astra:以偏好與法律脈絡提升文件草擬(文章精選)