核心概念

每週有超過 2.3 億人向 ChatGPT 諮詢健康相關問題——解讀血液報告、準備就醫前的問題清單、搞懂保險理賠條款、建立更健康的生活習慣。這個龐大的需求基數,使 ChatGPT 的健康回應品質成為真正的公共衛生議題。

2026 年 6 月 18 日,OpenAI 發布《Improving health intelligence in ChatGPT》,宣告以 GPT-5.5 Instant 取代 GPT-5.3 Instant 作為 ChatGPT 的預設模型,並重點說明此次升級在健康領域的具體改善。這也是 GPT-5.5 Instant:ChatGPT 預設模型的幻覺減半與個人化升級 中幻覺大幅降低的延伸成果在醫療場域的具體體現。

HealthBench Professional 評估框架

衡量進步的核心工具是 HealthBench Professional——OpenAI 專為臨床場景設計的評估基準,其特色在於:

  • 真實對話模擬:使用真實健康諮詢場景的對話結構,而非教科書問答
  • 醫師撰寫評分標準(Rubrics):由臨床醫師制定評估維度,而非工程師
  • 六大評估維度:準確性(Accuracy)、安全性(Safety)、溝通品質(Communication)、脈絡意識(Context Awareness)、完整性(Completeness)、適當轉介(Appropriate Escalation)

GPT-5.5 Instant 在 HealthBench Professional 的綜合分數上,達到了與 OpenAI 最新前沿 Thinking 模型相當的水準——對一個面向免費用戶的預設模型而言,是重要里程碑。相較前一代 GPT-5.3 Instant,改善幅度被評為「substantial」(實質性提升)。在最具挑戰性的健康評估題目上,性能直接看齊 Thinking 模型。

四大能力躍升

1. 辨識緊急醫療需求:模型能更準確地識別哪些症狀可能需要立即就醫,並主動建議使用者尋求緊急協助,而不只是提供資訊性回答。

2. 主動蒐集背景脈絡:面對模糊詢問時,模型會系統性地追問相關情境資訊(如病史、目前服用藥物、症狀持續時間),使回應更貼近個別狀況。

3. 清晰表達不確定性:對醫學界尚無定論或個案差異大的問題,模型能明確說明自身知識邊界,避免過度肯定的誤導性回答。這種「適當不確定性」的傳達本身就是健康溝通的核心技能。

4. 化繁為簡:複雜醫學概念、診斷邏輯、藥物作用機制,模型能以更口語的方式解釋,同時不損失核心準確性。

醫師盲評:3,500 個互動案例

OpenAI 組織了一個獨立醫師評估小組,針對 3,500 個互動案例進行盲測——評估者不知道回應來自 AI 或真實醫師。結果顯示,在準確性、溝通品質、完整性三個維度上,GPT-5.5 Instant 的回應評分均高於醫師手寫的對照回應。

這個結果需要審慎解讀:醫師回應評分較低,部分原因是時間限制與情境差異(真實醫師撰寫回覆的場景不同於 AI);但在格式化問答場景中,AI 確實能在特定溝通指標上超越個別人類專業者。

真實流量監控:71% 事實性問題降幅

除基準測試外,OpenAI 引用了真實流量數據:過去兩個月內,被標記為事實性問題的健康回應比率下降了 71%。這個數字來自 OpenAI 內部品質監控系統,反映真實使用場景而非測試集,因此具有較強的外部效度,與 GPT-5.5 Instant 系統卡:High-Capability 安全評估框架 中的安全評估相互呼應。

關鍵要點

  • 免費用戶全面受惠:GPT-5.5 Instant 是所有層級用戶的預設模型,健康智能升級無需付費
  • HealthBench Professional 六維評估:準確性、安全性、溝通品質、脈絡意識、完整性、適當轉介——由醫師制定標準
  • 達前沿 Thinking 模型水準:在最具挑戰性的健康評估題目上,預設免費模型性能看齊最高規格模型
  • 醫師盲評 3,500 案例:準確性、溝通、完整性三維度均優於醫師手寫回應(注意評估情境限制)
  • 71% 事實性問題降幅:兩個月真實流量監控,比測試集更能反映用戶實際體驗

實務應用

此次升級對使用者最直接的影響體現在三個高頻場景:

就醫前準備:描述症狀後,ChatGPT 現在更能幫助整理關鍵問題清單,並提醒哪些資訊應主動告知醫師(而非等被問)。模型也更能判斷哪些情況應直接建議掛急診或立即就醫。

健康報告解讀:血液報告、影像報告的術語,模型以更貼近非醫學背景者的語言解釋,同時指出哪些數值值得與主治醫師進一步討論——這比 ChatGPT 緊急聯絡人:OpenAI 的自傷風險通報機制 的被動安全防護進一步前移,轉為主動的健康資訊引導。

習慣改變建議:飲食、運動、睡眠等建議,模型能更好地結合使用者提供的個人背景(慢性病史、藥物使用)給出更合適的回應,而非套用通用範本。

這些改善體現了 OpenAI 的核心策略:讓 AI 在醫療資訊這個高風險域中,扮演「知識豐富但懂得謙遜」的協助者角色。相比 AI 共診醫師——Google DeepMind 臨床 AI 研究 側重臨床輔助決策,OpenAI 的路徑更聚焦在面向一般大眾的健康素養提升。

延伸觀點

1. AI 在結構化評估中持續優於醫師基準

HealthBench Professional 的完整論文數據顯示,GPT-5.4 in ChatGPT for Clinicians 在 525 個真實臨床任務上評分 59.0,而醫師基準僅 43.7;在紅隊對抗案例中差距更大(55.8 vs 30.0)。另一份評估論文分析了更專精的 DR. INFO(一個臨床 RAG 代理)在 HealthBench Hard 上達到 0.68,相較通用 GPT-5 的 0.46 高出 48%。這兩個獨立研究共同指向:無論是通用大模型還是領域特化系統,均已在結構化健康評估中超越醫師基準。不過兩篇論文均強調,基準分數不能直接換算為真實臨床表現——困難案例被大量過採樣,測試條件並不反映典型診療場景。

2. 領域特化仍有顯著效益:專科 AI > 通用前沿模型

DR. INFO(RAG 增強臨床助理)vs 基礎 GPT-5 的差距,揭示一個在 OpenAI 的報告中未被充分討論的問題:即使 GPT-5.5 Instant 的健康表現已大幅提升,領域特化 fine-tuning 加上即時醫療資料庫檢索,仍比通用模型高出接近一個數量級。溝通(0.75)和準確性(0.73)是 DR. INFO 的強項,但脈絡蒐集(0.62)和完整性(0.58)仍相對弱——這與 OpenAI 此次強調「主動蒐集背景脈絡」的改善方向高度吻合。

3. 醫師評估者之間的意見分歧本身即是有意義的信號

Decomposing Physician Disagreement in HealthBench(arxiv.org)的分析指出:醫師評估者之間的分歧,不是評估誤差,而是反映真實的臨床不確定性。不同專科的「可爭議性」不同,評分分歧在 AI 性能接近能力邊界時最為明顯。這意味著「AI 優於醫師」的敘事需要更精細的解讀——在高共識領域(如文件撰寫、紅隊對抗),AI 優勢清晰;在高度不確定的臨床判斷領域,評估本身的可靠性仍有根本限制。

反向連結

以下頁面引用了本頁: