核心觀點
心理健康對話不是只有「有沒有觸犯禁令」的二元問題:從日常壓力、關係困擾到明確危機,模型都得理解脈絡、尊重使用者自主性,並在需要時把人帶往真實世界支援。OpenAI 發布的 MentalHealthBench 是一個開放基準,試圖以臨床專家的細緻判準,衡量 AI 回應是否既安全又真正有幫助。它不把 ChatGPT 定位為治療或專業照護的替代品,而是為模型評估建立更可檢視的共同語言。
基準如何把「好的回應」拆開量測
MentalHealthBench 由 22 個國家、80 多位具執照的心理學家與精神科醫師共同制定;參與者使用 19 種語言,涵蓋近 20 個心理健康次專科。資料以隱私保護方式製作成合成對話,納入成人、13–17 歲青少年、照護者與臨床人員,並按急迫程度分為日常/非急性、高急性與需立即求助的緊急情境。部分個案也提供如家庭喪親等背景,測試模型會不會據此調整回應,而非只對最後一句話做機械反應。
每段對話至少由三位專家閱讀,針對最後一則提問寫出具體 rubric,例如是否先詢問關鍵脈絡、是否提供合宜而可執行的下一步、是否避免有害建議;只有至少兩人同意、且未被第三人否定的標準才被保留。每項準則權重介於 -10 至 +10,讓臨床重要性更高的有益或有害行為,對總分有相應影響。這比單一總分更有用:同樣分數的模型,可能一個擅長追問脈絡、另一個更會提供行動建議,改善方向並不相同。
技術亮點與詮釋邊界
基準使用 GPT‑5.6 Sol 依專家寫定的準則自動評分,並提供十個行為面向的拆解。因此它兼顧規模化測試與可解釋性,但仍應把自動評分器、合成資料與基準覆蓋範圍視為方法限制,而不是把分數當成臨床效力或真實世界安全的保證。
OpenAI 另找來 44 位曾以 AI 尋求情緒或心理支持的成人(16 國、14 種語言),比較「專家認為正確」和「使用者實際覺得有幫助」的差異。結果顯示,使用者更重視語氣與具體下一步;專家則更重視蒐集相關脈絡與審慎解讀模糊訊號。這提醒評估設計不能只選一方:同理但過度武斷不妥,專業地追問卻冷漠空泛也無法真正支持人。
與既有安全機制的連結
這套評估補上 ChatGPT 敏感對話安全升級:跨輪次脈絡感知與安全摘要機制 所處理的核心難題:危險訊號常分散在多輪對話中,不能只看單句字面。也與 ChatGPT 緊急聯絡人:OpenAI 的自傷風險通報機制 形成分工:前者檢驗回應是否能判讀脈絡與安全引導,後者則嘗試在高度困擾時連結可信任的人。對產品團隊而言,最佳實作不是宣稱 AI 能「處理心理健康」,而是以急迫度分流、保留真人與危機資源入口、持續測量錯失與過度介入,並讓使用者知道系統的能力邊界。
實務意義
若要採用此類基準,應同時檢查四件事:資料是否涵蓋目標語言與使用者族群;專家準則能否接受外部審視;自動評分是否對不同模型公平;以及高風險失敗能否由真人覆核、事件追蹤與危機流程接住。MentalHealthBench 的價值不在替任何模型貼上「安全」標籤,而在於使安全、脈絡、主體性與可行建議成為可公開討論、可迭代改善的工程目標。
來源
- OpenAI(2026-09-23),〈Introducing MentalHealthBench〉:https://openai.com/index/introducing-mentalhealthbench
- 原文快照:
raw/articles/openai-introducing-mentalhealthbench-2026-09-23.md
反向連結
以下頁面引用了本頁: