核心概念

2026 年 6 月 17 日,OpenAI 發布 LifeSciBench——一套由生命科學領域頂尖專家親自撰寫並審核的 AI 評估基準,旨在測試 AI 系統能否真正承擔現實的生命科學研究決策。

不同於既有的生物 AI 評估通常依賴選擇題或事實記憶,LifeSciBench 評估的核心問題是:AI 能不能像科學家一樣思考? 它要求模型完成需要多步推理、整合多媒體資料、並對科學判斷作出開放式回答的任務。

基準測試架構

規模與來源

  • 750 個研究任務,涵蓋 1,062 件附件(DNA 序列、化學結構、圖表、PDF 等)
  • 173 名博士級科學家共同撰寫(來自生物技術與製藥研究領域)
  • 453 名獨立審稿人交叉驗證,其中 97% 擁有博士學位
  • 19,020 條評分標準(每題平均 25 條原子級評分細則)

七大研究工作流程

  1. 證據處理與分析(Evidence Handling & Analysis)
  2. 設計與優化(Design & Optimization)
  3. 科學推理(Scientific Reasoning)
  4. 驗證與操作(Validation & Operations)
  5. 轉化(Translation)
  6. 科學溝通(Scientific Communication)

七大生物學領域

  • 基因組學(Genomics)
  • 藥物化學(Medicinal Chemistry)
  • 臨床與轉化科學(Clinical & Translational Science)
  • 以及另外四個跨學科生物專業領域

任務難度特徵

  • 79% 的任務需要多步推理,平均每題需要 4 個推理步驟
  • 53% 的任務要求整合附件(圖、序列、化學結構等)中的資訊

評分機制:原子級評分標準(Rubric-Based Grading)

傳統 benchmark 依賴「對 / 錯」二元比對,LifeSciBench 採用更細緻的原子評分:每個評分標準只對應一個特定屬性(一個事實、一個推理步驟、或在容許誤差內的數值答案)。最終分數分兩種維度:

  • 正規化分數(Normalized Score):答對標準數 ÷ 總標準數(支援部分給分)
  • 通過率(Task Pass Rate):正規化分數 ≥ 70% 才算通過該題

關鍵要點

各模型評估結果

模型 正規化分數 任務通過率
GPT-Rosalind(OpenAI 專業化模型) 0.576 36.1%
GPT-5.5 0.519 25.7%
Gemini 3.1 Pro 0.515 23.6%
GPT-5.4 0.479 20.7%
Grok 4.3 0.399 13.0%
  • GPT-Rosalind 在 750 題中的 386 題拿下最高分,但 Gemini 3.1 Pro 在 214 題上獨占鰲頭——說明沒有任何模型能全面主導所有科學子領域
  • 目前最強模型每三題只能通過一題,基準測試仍遠未飽和
  • 22.8%(171 題)沒有任何模型能通過;34.8%(261 題)最佳模型通過率低於 20%

附件處理是最大瓶頸:GPT-Rosalind 在純文字任務通過率為 45.1%,但附件任務直接下降到 28.1%,意味著 AI 的「閱讀科學文獻」能力仍是瓶頸所在。

任務類型差異懸殊:模型在「科學溝通」子類表現最佳(平均正規化分數 0.718),但在「設計與優化」最弱(通過率僅 30.7%)。

基準測試的設計意義:LifeSciBench 不只是測試 AI「知不知道」,而是測試 AI「能不能做到」。這是從靜態知識評估向動態工作流評估的根本轉向,也是 可信任第三方 AI 評估:OpenAI 指引手冊 中所強調的評估方向。

實務應用

對藥物研發的意義:LifeSciBench 的設計和藥物研發的典型工作流程高度對應——從文獻分析、假設提出、實驗設計到臨床轉化,每個環節都被納入評估。這讓研究機構可以用它來判斷 AI 系統是否真的能輔助科研決策,而非只是提供表面上的文字回應。

與 Rosalind 系列的連動:GPT-Rosalind 是 OpenAI 針對生物醫學領域特化訓練的模型,也出現在 Rosalind Biodefense:OpenAI 的生物防禦 AI 計畫 中。LifeSciBench 是 Rosalind 系列的公開能力驗證機制,透明度高於傳統內部評估。

和 AI Eval 成本問題的交集AI Eval 成本危機:評估比訓練更貴 指出評估本身的成本正在暴增;LifeSciBench 以 rubric 替代人工逐題評分,一定程度上是對這個問題的工程解法——但 19,020 條評分標準的初始建構成本依然相當可觀。

延伸觀點

LifeSciBench 的出現並非孤例,它代表了 AI 評估範式的系統性轉變——從「考 AI 記得什麼」轉向「考 AI 能做什麼」。

多項研究共同指出的趨勢:BABE(Biology Arena Benchmark,2025)和 IntuitionLabs 的 LLM 生命科學評估綜述都強調,現有生物學 AI 評估框架存在共同缺陷:過度依賴選擇題與單一參考答案,無法捕捉真實科學工作的迭代與多步推理本質。BABE 強調需要基於同行評審論文的「實驗推理」任務,而 IntuitionLabs 的報告更直接點出 MedQA 等主流醫療 benchmark 有 7.4% 的題目因關鍵資訊缺失而本身就「不適合評估」。

LifeSciBench 的差異化設計:在這個背景下,LifeSciBench 的 rubric 設計具有結構優勢——它允許部分給分,能區分「方向對但細節錯」和「完全錯誤」,更接近真實科研的品質評估標準。但這也帶來挑戰:19,020 條評分標準本身是否具有一致性?專家間的評分差異如何控制?LifeSciBench 的論文中並未完整揭露評分者一致性(inter-rater reliability)數據。

下一步的研究空白:兩份來源共同建議的方向是「多步 agentic workflow 評估」和「多模態整合」——LifeSciBench 已朝這個方向邁出重要一步,但在時序任務(如模擬多輪實驗假設修正)和合規要求(如 FDA 標準)方面仍有大量空白。與 Co-Scientist:AI 加速細胞老化逆轉基因發現 所呈現的 AI 輔助科研實際案例相互對照,評估和落地之間的差距仍然顯著。

反向連結

以下頁面引用了本頁: