核心觀點
英國 AI Security Institute(AISI)開始透過 EvalEval 的 Evaluation Cards 公開已報告評測的結果、脈絡與設定資訊,將「一個分數」還原成可檢查的實驗紀錄。這不是宣告某模型必然更好,而是讓研究者知道分數在何種推論預算、評測協定與執行條件下產生;當重跑成本高昂時,這是讓外部人能重現、質疑與比較結果的基礎。^[raw/articles/huggingface-evaleval-aisi-2026-09-22.md]
此合作把 EEE × Hugging Face:AI 評測結果標準化的統一入口 所建立的 Every Eval Ever(EEE)結構實際用在 AISI 的公開評測。EEE 負責以共同 schema 記錄模型、基準、執行與結果等資料;Evaluation Cards 則把基準元資料、評測 run 與模型資料呈現為可閱讀、可比較的卡片。兩者的重點都不是消滅不同評測工具,而是讓原本無法相互解讀的紀錄擁有共同座標。
這次公開了什麼
AISI 釋出主實驗中五個基準的已驗證結果與配置:HealthBench、FrontierMath、Humanity’s Last Exam、SWE-Bench Pro、Terminal-Bench 2.0;涵蓋 Claude Opus 4/4.5/4.6、GPT-5/5.2/5.4,另有 Cyber CTFs 與 The Last Ones 的網路安全評測資料。資料配合論文 How Inference Compute Shapes Frontier LLM Evaluation,直接凸顯同一模型的結果會隨推論時運算量與評測協定改變。^[raw/articles/huggingface-evaleval-aisi-2026-09-22.md]
這點很重要:排行榜分數是高度壓縮的摘要。若沒有每次 run 的模型版本、提示與生成設定、預算、評分規則及脈絡,讀者無法分辨差異來自模型能力、推論配置,還是環境條件。公開 transcript 層級或足以診斷的設定資訊,才能讓後續研究定位「為什麼不同」,而非只爭論「誰比較高」。
技術與治理意義
AISI 同時把此工作放在評測效率(OptStop)、統計嚴謹性(HiBayES)、逐字稿分析及 capability elicitation 的脈絡中。這說明可重現性不是單一欄位是否填寫,而是一條鏈:以標準格式保存資料、揭露影響分數的協定、使用合適統計方法,再讓外部人能檢視或再分析。
對實務團隊而言,這也回應 AI Eval 成本危機:評估比訓練更貴 的困境:完整重跑前沿評測可能昂貴到只有少數機構負擔得起。共享可驗證的 run 資料不能取代獨立複測,卻能避免每個人從零開始,也讓有限的複測預算優先用在最可疑、最關鍵的設定上。
導入判讀清單
- 看分數前先看條件:比較模型時確認基準版本、推論 token/嘗試次數、是否有正確性回饋、工具環境與評分方式。
- 保存可追溯 run:內部評估至少保留模型版本、配置、輸入輸出、成本與失敗原因,讓結果可被重算或審計。
- 把平均值與穩定性分開:一次高分不等於可靠;可搭配 ALTK-Evolve 一致性指南:補足 AI Agent 可重現性缺口 的 Mean@k/Pass^k 思路,量測重跑後是否仍成立。
- 不把公開卡片誤讀為獨立背書:本次資料是 AISI 與 EvalEval 提供的已驗證公開結果;其價值在透明度與可檢查性,特定模型優劣仍須依目標任務、版本與獨立重現判斷。
相關頁面
反向連結
以下頁面引用了本頁: