核心概念
OpenAI 於 2026 年 7 月 9 日公告「GPT‑5.5 生物漏洞賞金計畫」,以現金懸賞邀請 AI 紅隊研究員測試模型在生物安全情境下的防護邊界。這是繼 Rosalind Biodefense:OpenAI 的生物防禦 AI 計畫 後,OpenAI 在生物安全領域推出的另一重要安全舉措。
計畫的核心挑戰只有一個:找出一組通用越獄提示(universal jailbreak),能在全新對話中(fresh session)、不觸發任何內容審查機制的前提下,讓 GPT‑5.5 成功回答五道預設的生物安全挑戰題。
所謂「通用」是關鍵:同一組提示必須跨越所有五個生物安全問題都有效,而非只針對其中一題。這一設計使攻擊難度大幅提升,逼近真實威脅模型——實際惡意行為者也需要可重複使用的攻擊手法,而非一次性技巧。
計畫規格
| 項目 | 細節 |
|---|---|
| 測試模型 | GPT‑5.5(僅限 Codex Desktop 存取版本) |
| 挑戰目標 | 通用越獄提示,從全新對話成功回答全部 5 道生物安全題 |
| 首位成功獎金 | $25,000(後調升至 $50,000) |
| 部分成功獎金 | OpenAI 酌情頒發,金額未公開 |
| 申請期間 | 2026 年 4 月 23 日 ─ 6 月 22 日 |
| 測試期間 | 2026 年 4 月 28 日 ─ 7 月 27 日 |
| 保密要求 | 所有提示、回應與發現受 NDA 約束 |
參與資格
計畫採邀請制為主、申請制為輔的雙軌入場:
- 受邀:向 OpenAI 已建立的可信任生物紅隊成員名單直接發出邀請
- 申請:提交簡歷(姓名、所屬機構、相關經歷),OpenAI 審核後決定是否開放存取
申請者須擁有 ChatGPT 帳戶並簽署保密協議。這種嚴格篩選機制確保敏感測試環境不被濫用。
生物安全策略脈絡
此計畫並非孤立事件,而是 OpenAI 系統性生物防禦策略的一環:
- Rosalind Biodefense:OpenAI 的生物防禦 AI 計畫:限制 AI 生物能力存取路徑的可信存取框架
- 智能時代的生物防禦:OpenAI 行動計畫:更廣泛的 AI 生物防禦行動計畫
- GeneBench-Pro:OpenAI 計算生物學 AI 基準測試:計算生物學評估(2026 年 6 月)
關鍵要點
- 越獄難度已顯著提升:業界研究指出,找到通用越獄所需時間已從早期的數分鐘延長至數小時以上;此計畫旨在確認 GPT‑5.5 是否仍存在可突破點
- 獎金上調是誠實訊號:計畫啟動後最高獎金從 $25,000 調升至 $50,000,反映 OpenAI 對攻克難度的認可,也表明問題尚未被解決
- 人工紅隊 > 自動攻擊:多輪人工紅隊測試的攻擊成功率(ASR)可達 75% 以上,遠高於自動化工具;人工測試者能找到模型無法預見的攻擊角度
- NDA 機制的雙面刃:保密確保研究成果不流入惡意行為者手中,但也使學術社群無法從這些發現中學習——與傳統漏洞揭露(CVD)的開放精神有根本差異
- 物理障礙仍是主要壁壘:即便模型洩露生物知識,實驗室存取、材料取得等物理制約仍是實際危害的主要限制(RAND 研究結論)
延伸觀點
AI 生物安全評估的測量矛盾
業界對 AI 生物安全風險存在根本分歧:RAND 研究認為現有 LLM 相比網路搜尋未顯著增加生物武器風險;但 AISI 評估報告則發現頂尖模型已超越 94% 病毒學專家,能協助解決複雜實驗室協議問題。
這個矛盾的根源在於評估框架差異:舊框架問「AI 能否產生有害內容」(二元問題),新的**有害能力提升(harmful capability uplift)**框架問「AI 能讓新手提升到何種專家水平」。後者更貼近現實威脅情境,也解釋了為何同一模型在兩種框架下呈現截然不同的風險評估結果。
通用越獄為何難以防禦
角色扮演框架的越獄攻擊因規避了模型對「直接有害請求」的模式辨識,成功率高達 89%(arXiv 多篇論文共同指出)。而「通用越獄」挑戰的特殊性在於要求跨問題轉移性——同一攻擊邏輯對不同問題都有效,排除了針對單一問題特調的技巧,更接近真實威脅者的攻擊需求。
紅隊外包化趨勢
OpenAI 與 Anthropic 等公司正將紅隊測試從內部移向外部專家網絡,以賞金激勵。這反映兩個現實:多元背景的研究者比內部團隊更能想出意外攻擊角度;隨著模型能力提升,傳統 safety training 不再充分,持續性對抗測試已成為必要防禦層。多代理網絡的湧現風險:Microsoft Research 紅隊測試報告 的方法論與此趨勢互相呼應。
另見:GPT-5.5 Instant 系統卡:High-Capability 安全評估框架
反向連結
以下頁面引用了本頁: