核心概念
GeneBench-Pro 是 OpenAI 於 2026 年 6 月 30 日發布的科學研究 AI 基準框架,評估 AI 代理在基因組學(genomics)、定量生物學(quantitative biology)與轉化生物醫學(translational biomedicine)中執行多步科學分析的能力。
問題背景:現有基準為何不夠
傳統 AI 基準測試大多評估知識記憶,無法反映真實研究工作的本質挑戰。計算生命科學家面臨的是「需要一系列判斷才能得出足以支撐下游決策的結論」——這個能力無法被標準問答題捕捉。GeneBench-Pro 將此能力命名為「研究品味(research taste)」並以此作為核心評估維度。
框架設計
共 129 道合成問題,橫跨 10 個主要領域、21 個子領域,以基因組學為核心,延伸至腫瘤學、藥物基因組學與臨床診斷:
- 每個問題的環境:獨立工作空間 + 刻意製造雜訊的原始資料集 + 實驗背景說明 + 推估目標
- 可用工具:Python、PLINK 2.0(基因組統計分析軟體)
- 評分機制:問題從已知因果結構生成,支援決定性評分(deterministic grading);模型輸出 JSON,含
reasoning欄位,同時評估數值精準度與推理品質
代表性問題類型
- 結構變異引導的腫瘤療法評估(如:TXR1 定向抑制劑在結構變異驅動腫瘤中的臨床效用)
- CRISPR 靶點驗證(基因組編輯語境下的靶點可行性分析)
- Mendelian 隨機化(因果推斷用於藥物靶點優先排序)
- QTL 分析、多組學整合
品質保證:82 道問題經外部領域專家審查,並稽核資訊洩漏與捷徑解法。每題預估需專家 20 至 40 小時完成——刻意設計超越現有 AI 能力邊界。
關鍵要點
模型表現排名(2026 年 6 月)
| 模型 | 通過率(最高推理設定) |
|---|---|
| GPT-5.6 Sol Pro | 31.5% |
| GPT-5.6 Sol | 28.7% |
| Claude Opus 4.8 | 16.0% |
| Gemini 3.5 Flash | 8.1% |
| GPT-5(原版 GeneBench) | < 5% |
即使最強模型也只能解決約三分之一的問題,超過 68% 的研究級任務仍屬困難。
計算效率飛躍
GeneBench-Pro 揭示了測試時間計算擴展(test-time compute scaling)的顯著效果:GPT-5.6 Sol 解題數量約為 GPT-5.2 的 6 倍,但使用 token 數僅為其三分之二——更長的推理鏈(而非更多參數)是提升科學任務性能的關鍵路徑。
「研究品味」的三個維度
- 問題識別:判斷資料集實際能支撐哪些問題
- 障礙診斷:識別測量誤差、選擇偏差、混淆因素、QC 失敗等分析障礙
- 策略彈性:在延伸工作流程中知道何時更換分析方法、何時結果可靠到足以支撐決策
公開資源
- Hugging Face:10 道代表性問題(含提示詞、分階段資料、報告 PDF 與評分合約)
- 50 題子集授權給 Artificial Analysis 進行第三方中立評估
實務應用
AI 輔助生命科學研究的現實門檻
31.5% 意味著 AI 可以承擔部分研究任務,但無法替代高度依賴判斷力的完整分析流程。更務實的使用場景是「AI 作為研究協同工具」,承接有限定義的子任務(如數據 QC 或統計方法選擇),而非全流程自動化。
此框架與 GPT-Rosalind:OpenAI 生命科學專用模型 形成配套:Rosalind 是提升能力的專用模型,GeneBench-Pro 是衡量進步的評估尺。從 OpenAI o3 罕見遺傳病診斷:NEJM AI 研究解析 可見 AI 在特定診斷任務已有臨床價值,但 GeneBench-Pro 揭示了從「特定任務」到「完整研究流程」之間的距離。另可參照 Talos:自動化迭代基因組重新分析突破罕見病診斷瓶頸 了解 AI 在基因組分析的實際部署案例,以及 可信任第三方 AI 評估:OpenAI 指引手冊 了解評估方法論的整體框架。
延伸觀點
AI 科學推理的瓶頸在「判斷過程」而非「知識量」
BiomniBench(bioRxiv 2026.05)的過程級評估發現,LLM 代理在生醫研究任務中最常失敗的不是「知識缺失」,而是「步驟轉換判斷」——決定何時從資料探索切換到模型建構、何時需要重新審視假設。這與 GeneBench-Pro 強調「研究品味」的設計哲學高度一致:問題不在於模型是否讀過相關論文,而在於能否在不確定的分析流程中做出適當判斷。
多組學整合是當前 AI 的上限
另一項以 11 種癌症多組學單細胞資料評估 AI 代理的研究(bioRxiv 2026.06)發現,即使是以 Claude Opus 4.8 為核心的代理系統,在多步多組學推理任務中表現仍相當有限——與 GeneBench-Pro 中 Claude Opus 4.8 僅 16% 通過率相互印證。需要同時整合基因組、轉錄組、表觀基因組層次推理的任務,仍是當前 AI 的瓶頸。
獨立評估結果仍待觀察
AI Weekly 編輯評論指出,OpenAI 自評分數存在潛在偏差風險(benchmark gaming),建議等待 Artificial Analysis 的獨立測試結果再做結論。GeneBench-Pro 開放 50 題子集的設計正是為此,但在完整私有集公開前,「問題選擇偏差」的疑慮仍無法完全排除。
反向連結
以下頁面引用了本頁: