核心概念

GeneBench-Pro 是 OpenAI 於 2026 年 6 月 30 日發布的科學研究 AI 基準框架,評估 AI 代理在基因組學(genomics)、定量生物學(quantitative biology)與轉化生物醫學(translational biomedicine)中執行多步科學分析的能力。

問題背景:現有基準為何不夠

傳統 AI 基準測試大多評估知識記憶,無法反映真實研究工作的本質挑戰。計算生命科學家面臨的是「需要一系列判斷才能得出足以支撐下游決策的結論」——這個能力無法被標準問答題捕捉。GeneBench-Pro 將此能力命名為「研究品味(research taste)」並以此作為核心評估維度。

框架設計

共 129 道合成問題,橫跨 10 個主要領域、21 個子領域,以基因組學為核心,延伸至腫瘤學、藥物基因組學與臨床診斷:

  • 每個問題的環境:獨立工作空間 + 刻意製造雜訊的原始資料集 + 實驗背景說明 + 推估目標
  • 可用工具:Python、PLINK 2.0(基因組統計分析軟體)
  • 評分機制:問題從已知因果結構生成,支援決定性評分(deterministic grading);模型輸出 JSON,含 reasoning 欄位,同時評估數值精準度與推理品質

代表性問題類型

  • 結構變異引導的腫瘤療法評估(如:TXR1 定向抑制劑在結構變異驅動腫瘤中的臨床效用)
  • CRISPR 靶點驗證(基因組編輯語境下的靶點可行性分析)
  • Mendelian 隨機化(因果推斷用於藥物靶點優先排序)
  • QTL 分析、多組學整合

品質保證:82 道問題經外部領域專家審查,並稽核資訊洩漏與捷徑解法。每題預估需專家 20 至 40 小時完成——刻意設計超越現有 AI 能力邊界。

關鍵要點

模型表現排名(2026 年 6 月)

模型 通過率(最高推理設定)
GPT-5.6 Sol Pro 31.5%
GPT-5.6 Sol 28.7%
Claude Opus 4.8 16.0%
Gemini 3.5 Flash 8.1%
GPT-5(原版 GeneBench) < 5%

即使最強模型也只能解決約三分之一的問題,超過 68% 的研究級任務仍屬困難。

計算效率飛躍

GeneBench-Pro 揭示了測試時間計算擴展(test-time compute scaling)的顯著效果:GPT-5.6 Sol 解題數量約為 GPT-5.2 的 6 倍,但使用 token 數僅為其三分之二——更長的推理鏈(而非更多參數)是提升科學任務性能的關鍵路徑。

「研究品味」的三個維度

  1. 問題識別:判斷資料集實際能支撐哪些問題
  2. 障礙診斷:識別測量誤差、選擇偏差、混淆因素、QC 失敗等分析障礙
  3. 策略彈性:在延伸工作流程中知道何時更換分析方法、何時結果可靠到足以支撐決策

公開資源

  • Hugging Face:10 道代表性問題(含提示詞、分階段資料、報告 PDF 與評分合約)
  • 50 題子集授權給 Artificial Analysis 進行第三方中立評估

實務應用

AI 輔助生命科學研究的現實門檻

31.5% 意味著 AI 可以承擔部分研究任務,但無法替代高度依賴判斷力的完整分析流程。更務實的使用場景是「AI 作為研究協同工具」,承接有限定義的子任務(如數據 QC 或統計方法選擇),而非全流程自動化。

此框架與 GPT-Rosalind:OpenAI 生命科學專用模型 形成配套:Rosalind 是提升能力的專用模型,GeneBench-Pro 是衡量進步的評估尺。從 OpenAI o3 罕見遺傳病診斷:NEJM AI 研究解析 可見 AI 在特定診斷任務已有臨床價值,但 GeneBench-Pro 揭示了從「特定任務」到「完整研究流程」之間的距離。另可參照 Talos:自動化迭代基因組重新分析突破罕見病診斷瓶頸 了解 AI 在基因組分析的實際部署案例,以及 可信任第三方 AI 評估:OpenAI 指引手冊 了解評估方法論的整體框架。

延伸觀點

AI 科學推理的瓶頸在「判斷過程」而非「知識量」

BiomniBench(bioRxiv 2026.05)的過程級評估發現,LLM 代理在生醫研究任務中最常失敗的不是「知識缺失」,而是「步驟轉換判斷」——決定何時從資料探索切換到模型建構、何時需要重新審視假設。這與 GeneBench-Pro 強調「研究品味」的設計哲學高度一致:問題不在於模型是否讀過相關論文,而在於能否在不確定的分析流程中做出適當判斷。

多組學整合是當前 AI 的上限

另一項以 11 種癌症多組學單細胞資料評估 AI 代理的研究(bioRxiv 2026.06)發現,即使是以 Claude Opus 4.8 為核心的代理系統,在多步多組學推理任務中表現仍相當有限——與 GeneBench-Pro 中 Claude Opus 4.8 僅 16% 通過率相互印證。需要同時整合基因組、轉錄組、表觀基因組層次推理的任務,仍是當前 AI 的瓶頸。

獨立評估結果仍待觀察

AI Weekly 編輯評論指出,OpenAI 自評分數存在潛在偏差風險(benchmark gaming),建議等待 Artificial Analysis 的獨立測試結果再做結論。GeneBench-Pro 開放 50 題子集的設計正是為此,但在完整私有集公開前,「問題選擇偏差」的疑慮仍無法完全排除。

反向連結

以下頁面引用了本頁: