核心概念

GeneBench-Pro 是 OpenAI 於 2026 年 6 月 30 日發佈的新一代計算生物學 AI 評測基準,設計目標是衡量 AI 模型能否完成真實研究場景中的科學分析任務——而非單純測試知識記憶。它是原版 GeneBench 的擴展升級版本,將評測範疇從基因組學延伸至量化生物學、藥物基因體學、腫瘤生物學、微生物基因組學以及臨床轉化醫學等多個交叉領域。

基準設計哲學:測試判斷力,而非知識量

GeneBench-Pro 的核心差異在於,它不問「這個基因功能是什麼」,而是給模型一份真實雜亂的實驗數據集、一段實驗背景描述、以及一個需要推論才能回答的研究問題,要求模型完整走完分析流程:選擇分析方法、處理數據噪音與歧義、得出可指導下游決策的結論。

這種設計抓住了計算生物學研究中最難自動化的部分:

  • 處理歧義:真實生物數據充滿技術噪音、批次效應、樣本異質性,需要判斷何種假設合理
  • 修正假設:分析過程中發現初始假設有誤,需要中途調整分析路徑
  • 選擇分析路徑:統計方法往往有多種合理選項,選錯導致結論偏差
  • 判斷結果是否可用:決定某個結果是否達到可指導臨床或研究決策的信心門檻

範疇與規模

整個基準包含 129 道題,橫跨 10 個主要領域與 21 個次領域,涵蓋:

  • 統計遺傳學(population stratification、GWAS、古 DNA 分析)
  • 癌症基因組學(液態活檢、腫瘤突變負荷)
  • 臨床診斷與轉化基因組學
  • 藥物基因體學
  • 蛋白質組學與分子組學
  • 微生物基因組學

為確保題目品質,OpenAI 將 129 道題中的 82 道送交外部領域專家評審,評審者涵蓋博士生、博士後研究員、業界科學家與大學教授,確認問題反映真實生物研究情境,且有可靠的標準答案。

模型表現:科研任務仍是高牆

測試結果顯示,目前最頂尖的模型在 GeneBench-Pro 上的通過率仍相當低:

模型 通過率(標準) 通過率(Pro/最高推理)
GPT-5.6 Sol(OpenAI) 28.7% 31.5%
Claude Opus 4.8(Anthropic) 16.0%
Gemini 3.5 Flash(Google) 8.1%

相比之下,OpenAI 的 GPT-5 在原版 GeneBench 開發期間得分低於 5%,顯示這一代模型已有顯著進步,但面對研究級的判斷任務,即便是最強模型也只能通過約三成。這個數字提醒了一個基本事實:通過率 31.5% 意味著超過 68% 的計算生物學真實研究任務,當前 AI 仍無法可靠完成。

關鍵要點

  • 範疇擴展:從原版的基因組學延伸至藥物基因體、腫瘤生物學、微生物基因組、臨床轉化,更貼近現實研究多樣性
  • 任務格式:每題提供真實(雜亂)數據集 + 實驗背景 + 研究問題,要求完整多步驟分析,不是選擇題
  • 外部審查:82/129 題經過研究人員與業界科學家同行評審,確保題目真實性與答案可靠性
  • 最強對手仍只過三成:GPT-5.6 Sol 在 Pro 模式下達 31.5%,Opus 4.8 為 16.0%,Gemini 3.5 Flash 為 8.1%
  • 與 GeneBench 的延續性:前代 GPT-5 在 GeneBench 中得分 < 5%,表明模型能力提升是真實的,但任務難度同步提升
  • 設計原則:刻意測量「判斷力缺口」——即現有 benchmark 通常測不到的系統性推理與不確定性管理能力

實務應用

對 AI 輔助生物醫學研究的意義

GeneBench-Pro 的發佈時機反映了一個行業關注點:隨著 AI 模型在標準問答測試中逼近人類專家水準,學界開始質疑這些分數是否能轉化為真實的科研能力。GeneBench-Pro 提供了一個更嚴苛的衡量維度——不是「模型知不知道答案」,而是「模型能不能走完整條分析流程並做出可信賴的判斷」。

從 31.5% 的最高通過率來看,目前的 AI 仍不能替代計算生物學家在複雜分析中的角色,但可以作為輔助工具,處理流程中標準化程度較高的環節(如數據預處理、已知分析管線的執行)。真正的瓶頸在於「科研判斷」這一層:何時改變假設、如何在多個合理假設中取捨——這也是 GeneBench-Pro 設計上刻意放大的測試維度。

延伸觀點

近期 arxiv 上的獨立研究與 GeneBench-Pro 的設計邏輯呼應,提供了幾個值得整合的觀察:

推理模型與非推理模型的差異化表現

CGBench(2025,臨床遺傳學文獻解讀基準)的研究發現,推理型模型(如 o-系列)在需要細粒度分析的任務中表現更優,但在需要整體判斷的任務上反而不如非推理模型。這個發現值得關注:GeneBench-Pro 中的任務同時包含細節分析與整體判斷,GPT-5.6 Sol 的領先優勢或部分來自模型在兩種模式之間的切換能力。

「表面正確」的陷阱

CGBench 還記錄了一個重要現象:模型在分類層面可能給出正確答案,但在追問推理過程時卻出現幻覺或誤解。這意味著 benchmark 得分不等同於模型理解了生物學原理——而 GeneBench-Pro 的多步驟設計正是為了避免這種表面正確性,強制模型展示完整分析路徑。

「跨越專家」的討論需要脈絡

另一篇 arXiv 研究(2505.06108,2025)指出前沿 LLM 在某些生物學測試中已超越人類專家,但研究同時強調:這些成績集中在知識密集型題目,而非開放式科研任務。GeneBench-Pro 的 31.5% 最高通過率提供了反向校準:在知識與判斷力並重的場景中,AI 距離「超越專家」仍有顯著差距。

相關頁面:Talos:自動化迭代基因組重新分析突破罕見病診斷瓶頸

反向連結

以下頁面引用了本頁: