核心概念

Wang 等人以 PRISMA 2020 流程進行系統性回顧與統合分析,比較「人類專業者加上大型語言模型」(H+AI)與僅由人類完成(H)的臨床工作流程。研究檢索四個資料庫至 2025 年 6 月 28 日,納入 10 篇同儕審查研究;另有 3 篇預印本只用於敏感度分析。問題不在於 LLM 能否答對一題醫學問答,而在於它加入真實工作流程後,是否真的改善臨床推理、文件撰寫與資料判讀。

摘要翻譯與結果

原文指出,LLM 支援的人機協作有潛力提升臨床推理、紀錄與判讀任務。診斷/判讀正確率的兩項研究呈正向趨勢:H+AI 的風險比為 1.59;但 95% 信賴區間為 0.08–32.74,範圍極寬、未達統計顯著,預測區間亦跨越無效值。換言之,現有證據尚不足以聲稱 AI 已穩定提高診斷準確率。

相較之下,兩項研究的「診斷/處置綜合分數」出現統計上顯著的改善。這提示 LLM 的價值可能較常出現在把病史、選項、紀錄與處置理由整合成可供醫師判斷的工作中,而非獨立給出單一診斷。然而納入研究數很少、異質性高,且預印本並未作為主要證據;結果應視為有前景的訊號,不是可直接推廣的臨床效益定論。

方法論亮點

這篇研究的關鍵是將「人機協作」視為可比較的工作流,而非把模型分數等同醫療成效。PRISMA 登錄與預先區分同儕審查研究、預印本敏感度分析,有助於避免把尚未成熟的結果放大。它也暴露目前評估的缺口:只有少量研究可合併,且不同任務、介入方式與評分尺規,使單一平均數難以代表所有臨床場景。

對實務的意義

醫療機構最可行的近程定位,仍是讓 AI 擔任「整理、提示與第二意見」層:協助彙整資訊、草擬紀錄、指出可能遺漏的考量,再由臨床人員驗證與承擔最終決策。這與 AI 共診醫師——Google DeepMind 臨床 AI 研究 的結論一致:即使模型在部分任務表現突出,高風險紅旗辨識與責任界線仍需人類把關。

本研究亦補足 MedGPT-oss:20B 開源生醫多模態語言模型 所代表的技術觀點:部署得起、能讀多模態資料,不等於改善了臨床結果。後續研究應採用前瞻性、多中心設計,明確交代 AI 介入時點、醫師是否採納建議、錯誤類型與病人安全結果;否則「人加 AI」的效益只會停留在看起來合理的平均分數。

延伸觀點

這份統合分析最有價值的提醒是:臨床 AI 的單位不是模型,而是人、流程、資料品質、介面與治理共同組成的系統。與其問 AI 能否取代醫師,更實際的問題是:它在哪一步提供可驗證的增益、又在哪一步必須被攔下。對高風險場景而言,能證明不傷害與可稽核,和能提升平均表現同樣重要。

反向連結

以下頁面引用了本頁: