核心概念

2026 年 7 月 8 日,OpenAI 發布 GPT-Live——新一代語音模型,目標是讓人與 AI 的對話接近真實人際交流。其核心突破在於兩項架構改變:全雙工(full-duplex)連續互動委派式推理

語音 AI 的三代演進

第一代:串接式(Cascaded) 原始 ChatGPT 語音將三個模型依序串接:語音轉文字(STT)→ 大型語言模型(LLM)→ 文字轉語音(TTS)。缺點明顯——模型間資訊流失、回應緩慢且生硬。

第二代:回合式(Turn-based) ChatGPT 進階語音模式(GPT-4o)在單一模型內處理音訊,降低延遲,但仍以「靜音偵測」判斷輪替,短暫停頓會被誤判為結束,容易在不自然時機插話。

第三代:全雙工(GPT-Live) GPT-Live 同時處理輸入與輸出,每秒多次判斷是否說話、繼續聆聽、暫停、插話或呼叫工具。模型能在對話中插入「嗯哼」、「對」等語句確認聆聽,讓來回互動顯得更自然。

委派式推理架構

GPT-Live 拆解為兩層:

  • 持續互動層:負責對話節奏與即時回應
  • 委派層:遇到需要搜尋、深度推理或代理任務時,在背景呼叫 GPT-5.5,完成後無縫帶回對話

這種分離讓 GPT-Live 能隨前沿模型更新而持續升級,不需重新訓練整個語音系統。

評測成果

在人類一對一比較評估(5–10 分鐘對話)中,GPT-Live-1 與 GPT-Live-1 mini 在整體偏好、輪流發言、插話、流暢度及自然程度上均顯著優於進階語音模式。基準測試同樣亮眼:

  • GPQA(生物、化學、物理專家推理)大幅優於進階語音模式
  • BrowseComp(代理式網路搜尋)有顯著提升
  • τ³-Voice Telecom(多輪電信客服任務)表現更優

關鍵要點

  • 全雙工核心:同時聆聽與說話,不依賴靜音觸發,避免不自然插話
  • 模型版本:GPT-Live-1(Plus/Pro/Go 用戶)與 GPT-Live-1 mini(免費用戶),API 即將開放
  • 視覺化卡片:語音對話中可顯示天氣、股票、體育等豐富視覺資訊
  • 安全設計:音訊原生評估、即時防護措施、青少年保護、情感依賴長期監控
  • 已知限制:發布時不支援影片/螢幕分享語音;部分語言帶有非母語口音

實務應用

每週已有超過 1.5 億人透過 ChatGPT 語音互動。GPT-Live 的使用場景包括:無手操作的日常協助(通勤、烹飪)、語言學習練習、長達 30-40 分鐘的深度諮詢對話。選擇推理強度(即時 / 中 / 高)讓使用者可在速度與深度之間切換。

相關頁面:Hugging Face × Cerebras:以 Gemma 4 打造實時語音 AI 堆棧 | Reachy Mini 本地化對話:語音 AI 管線的離線部署實錄

延伸觀點

語音將成為下一個主要計算介面(TechCrunch、MarkTechPost 共同指出):OpenAI 明確將語音定位為「複雜工作的主要計算介面」,不只是問答工具。委派架構讓語音 AI 首次能處理需要搜尋與推理的長任務,同時維持對話流暢——這是之前所有語音系統無法做到的。

競爭格局加速成形(TechCrunch):Apple Siri 與 Amazon Alexa 也正同步升級對話自然度與上下文處理。新創公司 Sesame 亦以自然對話體驗為主打切入市場。全雙工語音正從差異化優勢快速演變為行業基準。

語言支援仍是短板(TechCrunch):GPT-Live 在英語以外的語言(如印地語)仍帶有美國口音,發音自然度不足。OpenAI 承認需要進一步最佳化各語言體驗——對非英語市場用戶而言,這是現階段的明顯限制。

反向連結

以下頁面引用了本頁: