核心概念

AI 評測正面臨「數據分裂」危機:同一個模型在同一個基準上,由不同機構跑出的分數可能相差超過 14 分。LLaMA 65B 在 MMLU 上的報告分數,最高與最低相差 14.9 分,這不是模型本身的差異,而是評測環境——使用哪個評估框架、什麼生成參數、幾 shot 提示——的差異。過去這些設定分散在論文附錄、部落格備注或 GitHub 自述文件中,沒有統一格式,等同於每次閱讀評測結果都要手動進行考古工作。

Every Eval Ever(EEE) 是 2026 年 2 月由 EvalEval Coalition 發起的社群項目,核心是一套統一 JSON schema,試圖為 AI 評測結果建立「出生證明」:不只記錄分數本身,也完整記錄分數如何被產生。

EEE schema 有五個核心欄位群:

  1. 來源元數據:誰執行評測、機構類型(第一方/第三方)、原始資料出處(論文/評估運行)
  2. 模型資訊:開發者、模型名稱、存取方式(API/本地引擎/推論平台)
  3. 生成配置:temperature、shots、stop sequences 等生成參數(明確缺失時也記錄為「未知」)
  4. 評測結果:每個指標含方向性、類型、數值範圍、不確定性估計與時間戳
  5. 實例級數據:選填的 _samples.jsonl,記錄每道題的模型輸出,支援單輪、多輪對話與 Agent 行為三種格式

截至 2026 年 5 月,EEE 資料庫已收錄 22,235 個模型、2,273 個獨特基準、超過 229,000 條聚合評測結果,相容 31 種既有評估格式。

Hugging Face 此次整合(2026 年 6 月)讓 EEE 與 HF Community Evals 系統打通:使用者將評測結果提交至兩個系統後,model card 上會直接顯示帶驗證徽章的分數,並附有連結指回 EEE 完整記錄。從模型頁面點擊分數,就能追溯到完整的生成配置——這是過去根本不可能做到的事。

關鍵要點

  • 評測分裂是系統性問題:在 EEE 現有數據中,「推論平台」欄位在 98% 的評測記錄中缺失或標記為「未知」,平均欄位填報率僅 27%——這意味著大多數公開評測結果都無法被可靠地重現

  • schema 設計刻意最小化:EEE 規定的欄位只記錄「影響結果的配置」,不強制要求完整方法論描述。此設計降低採納門檻,優先讓社群產出可機器讀取的結構化紀錄,而非完美文件

  • 自動轉換器覆蓋主流框架:官方提供 HELM、lm-eval-harness、Inspect AI 的轉換工具;HF Community Evals Converter 支援 MMLU-Pro、GPQA、HLE、GSM8K 四個基準,並在提交前自動審核現有結果、偵測衝突,需使用者明確確認才開啟 PR

  • 不可變紀錄 + 明確修正:EEE 採用「提交後不可更改,錯誤透過修正和撤回機制處理」的設計,保留完整審計軌跡,而非允許靜默覆蓋

  • 成本節省論述:保守估計,重現 EEE 資料庫中所有評測需要數十萬美元計算成本;透過共享結果,社群避免了重複的計算浪費,見 AI Eval 成本危機:評估比訓練更貴

實務應用

Eval Cards(arxiv:2606.09809,與 EEE 配套的解讀層)將 EEE 數據、基準元數據、模型元數據組合成四個可計算的品質信號:

  • 可重現性:生成參數是否完整
  • 報告完整性:28 個 schema 欄位的填報率
  • 來源溯源:第一方 vs 第三方標記
  • 可比性:相同模型在不同提交者之間的設定差異

這四個信號讓評測消費者能快速判斷一筆分數的「可信程度」,不必手動比對原始論文。詳細的第三方評估框架設計可參考 可信任第三方 AI 評估:OpenAI 指引手冊前沿 AI 第三方評估手冊:OpenAI 的信任框架與失真風險管控

使用 HF Community Evals Converter:

uv run tools/hf-community-evals/community_evals_converter.py MMLU-Pro \
  --datastore evaleval/EEE_datastore@main

工具執行後比對目標模型的現有 community evals 記錄,若偵測到衝突分數會在確認前列出差異。轉換後的 YAML 自動附加 EEE source URL,讓 model card 上每個分數都指向可追溯的完整紀錄。

延伸觀點

綜合三篇相關論文的交叉驗證:

item-level 數據才是真正的可重現性基礎(2 篇以上共同指出)。EEE 論文與 arxiv:2604.03244 均強調,集合層級的分數是有損壓縮——構念失衡(某個能力子項對總分貢獻不成比例)和數據污染(訓練/測試重疊)只在題目層級才可見。EEE 的 _samples.jsonl 設計雖為選填,正是回應這個根本性的方法論缺口;若 AI 評測社群要成為「可累積的科學」,item-level 資料的公開共享遲早會從建議變成規範。

評測分裂不是技術問題,是治理問題(2 篇以上共同論點)。EEE 論文揭示:五家公司佔最常評測模型的 96%,美國模型主導排行。評測生態系本身也存在集中化風險——誰有計算資源去評、誰的模型被最多次評,決定了哪些能力被「社群共識」記錄在案。EEE 透過開放提交與版本管理試圖分散這個權力,但社群採納率能否打破現有集中格局,仍有待觀察。

schema 互通性比單一標準更可行(EEE 與 Eval Cards 共同論點)。Eval Cards 採用「組合」而非「取代」的設計哲學——接受來自 EEE、基準卡、模型登錄的異質數據,透過標準化 ID 對齊,而非要求所有人改用同一格式。這與 EEE 的最小化 schema 策略一致,也與 Appia Foundation 等跨組織標準化努力的方向相符:不強制統一,而是建立可機器讀取的結構化指針,讓現有格式繼續存在的同時實現互通。

反向連結

以下頁面引用了本頁: