核心概念
2026 年 7 月 8 日,OpenAI 發布分析報告《Separating Signal from Noise in Coding Evaluations》,指出廣受使用的程式碼評估基準 SWE-Bench Pro 存在嚴重的任務品質問題,並正式撤回此前向研究社群推薦的立場。
這是 AI 評估領域近年來最具衝擊性的自我糾錯案例之一:OpenAI 自己推薦的基準,自己來拆穿。
背景:基準測試的替換鏈
SWE-bench 系列的可靠性問題不是首次出現。
SWE-bench Verified(較早版本)曾是業界主要的程式碼代理評估標準。然而,OpenAI 在後續調查中發現它存在根本性的設計缺陷與資料污染(訓練資料洩漏),導致模型分數虛高、評估信號失真。OpenAI 隨即放棄使用,並向社群推薦改用 SWE-Bench Pro——一個針對更長執行期限、更接近真實情境所設計的新版本,共收錄 731 個公開任務。
然而,這次 OpenAI 對 SWE-Bench Pro 的審計結果,同樣令人警覺。
審計方法:雙軌驗證
OpenAI 採用兩種互補方式進行審計:
自動化 Pipeline:建立任務資料品質評估系統,對每個 datapoint 重複進行代理輔助審查(investigator-agent passes),結合模型嘗試記錄、任務元資料、失敗追蹤進行多角度分析。
人工標注:邀請五位有豐富經驗的軟體工程師,對被標記的任務進行獨立審查,交叉比對自動化結果。
審計結果:三成任務有問題
| 審計方式 | 問題任務數 | 占比 |
|---|---|---|
| 自動化 Pipeline | 200 個 | 27.4% |
| 人工標注 | 249 個 | 34.1% |
兩種方法的差距最主要來自「低覆蓋率測試」:人工審查員將其標記為問題的比率是 9.4%,而自動化系統只標記了 4.1%。這類任務之所以難以被機器察覺,正是因為測試表面上會通過,但實際上沒有充分驗證功能需求。
四大問題類型
1. 過度嚴格的測試(Overly Strict Tests) 測試強制要求特定實作細節(implementation details),而這些細節並未在任務提示中說明。導致功能正確的解法也會被判定失敗,模型能力被低估。
2. 規格不完整的提示(Underspecified Prompts) 任務提示省略了部分需求,但隱藏測試案例卻會驗證這些需求。模型無從得知完整規格,評估變成「猜謎」。
3. 低覆蓋率測試(Low-Coverage Tests) 測試案例不足以充分驗證所要求的功能,導致不完整的修復能通過測試。模型能力被高估。
4. 誤導性提示(Misleading Prompts) 提示內容指向錯誤的實作方向,或與測試案例所要求的行為相互矛盾,讓模型陷入兩難。
飽和問題:分數已失去區辨力
除了任務品質問題,SWE-Bench Pro 還面臨「飽和」困境:前沿模型的通過率在短短八個月內從 23.3% 躍升至 80.3%,正在逼近基準設計的噪聲上限。當大多數「正確任務」都被頂尖模型輕鬆解決,剩下的題目可能多數屬於有缺陷的評估項,而非真正困難的工程挑戰。
影響:評估可靠性是安全決策的基礎
OpenAI 在報告中強調,評估的可靠性不只是研究排名的問題,而是關乎 AI 安全與部署決策:
若評估缺陷影響分數,它們會給出對能力的錯誤理解,誤導安全案例判斷,影響研究優先順序的設定。
這意味著,一個被污染的基準不僅讓競爭排名失真,更可能讓研究者以為某個模型達到了「安全閾值」,實際上卻沒有。
關鍵要點
- SWE-Bench Pro 的公開 731 個任務中,自動審計標記 27.4% 有問題,人工審計達 34.1%
- 四大問題類型:過度嚴格測試、規格不完整提示、低覆蓋率測試、誤導性提示
- 低覆蓋率測試是人工與自動化審計落差最大的類型(9.4% vs 4.1%),難以自動偵測
- 前沿模型八個月內從 23.3% 升至 80.3%,基準正在快速飽和
- OpenAI 正式撤回推薦 SWE-Bench Pro 作為主要編程評估基準的立場
- 這是 SWE-bench 系列的第二次重大可靠性危機:SWE-bench Verified 因污染被放棄,SWE-Bench Pro 因任務品質問題被撤回
實務應用
對使用這類基準做決策的團隊而言,本次審計有幾個直接啟示:
評估基準不是絕對真理:任何基準都有其設計假設與缺陷。在將模型能力聲明連結到安全決策時,需要額外的驗證機制。
人工審計不可替代:自動化 pipeline 在低覆蓋率測試的偵測率明顯低於人工,說明目前工具尚無法全面取代領域專家的判斷。
快速飽和的訊號:若基準通過率在數個月內快速躍升,通常代表基準設計有缺陷(太多噪聲任務)或模型已過擬合(資料污染),而非真正的能力提升。
相關討論見 可信任第三方 AI 評估:OpenAI 指引手冊 與 AI Eval 成本危機:評估比訓練更貴。
延伸觀點
基準飽和是系統性問題
ICML 2026 發表的大規模研究(分析 60 個語言模型基準)發現,近半數基準都出現飽和現象,且飽和率隨基準年齡增加而上升。值得注意的是,公開測試資料並不是防止飽和的關鍵——專家精心設計的任務才是讓基準具備長期鑑別力的核心因素。這一點與 OpenAI 的人工審計能發現自動化系統漏掉的問題相互呼應:評估品質需要深度人工投入,無法完全自動化。
現有基準與真實代理工程的落差
KDD'26 的 Workshop 論文指出,SWE-bench 等現有編程基準主要評估孤立的任務完成能力,但真實的代理軟體工程需要系統級協調、長期規劃、與既有程式碼庫的相容性,這些維度在現有基準中幾乎缺席。SWE-Bench Pro 雖試圖加入更長執行期限,但任務設計的根本框架仍停留在孤立補丁層次,難以反映生產環境中的代理能力。兩篇分析共同指向同一方向:業界需要的是重新設計評估框架,而非不斷修補現有基準。
項目級數據透明度是解法基礎
一篇 2026 年的評估方法論論文呼籲,AI 評估應強制要求發布標準化的項目級數據(item-level data)。聚合分數(如整體通過率)會掩蓋任務間的差異表現,讓研究者無法診斷模型真正的弱點與強項,也無法偵測哪些任務已被污染或設計有缺陷。若 SWE-Bench Pro 從設計之初就採用項目級透明度機制,此次危機或許可以更早被社群發現,而非等到 OpenAI 主動審計才浮出水面。
反向連結
以下頁面引用了本頁:
- AI Eval 成本危機:評估比訓練更貴(文章精選)
- 可信任第三方 AI 評估:OpenAI 指引手冊(文章精選)