核心概念
2026 年 7 月 8 日,OpenAI 發布 GPT-Live——新一代語音模型,目標是讓人與 AI 的對話接近真實人際交流。其核心突破在於兩項架構改變:全雙工(full-duplex)連續互動與委派式推理。
語音 AI 的三代演進
第一代:串接式(Cascaded) 原始 ChatGPT 語音將三個模型依序串接:語音轉文字(STT)→ 大型語言模型(LLM)→ 文字轉語音(TTS)。缺點明顯——模型間資訊流失、回應緩慢且生硬。
第二代:回合式(Turn-based) ChatGPT 進階語音模式(GPT-4o)在單一模型內處理音訊,降低延遲,但仍以「靜音偵測」判斷輪替,短暫停頓會被誤判為結束,容易在不自然時機插話。
第三代:全雙工(GPT-Live) GPT-Live 同時處理輸入與輸出,每秒多次判斷是否說話、繼續聆聽、暫停、插話或呼叫工具。模型能在對話中插入「嗯哼」、「對」等語句確認聆聽,讓來回互動顯得更自然。
委派式推理架構
GPT-Live 拆解為兩層:
- 持續互動層:負責對話節奏與即時回應
- 委派層:遇到需要搜尋、深度推理或代理任務時,在背景呼叫 GPT-5.5,完成後無縫帶回對話
這種分離讓 GPT-Live 能隨前沿模型更新而持續升級,不需重新訓練整個語音系統。
評測成果
在人類一對一比較評估(5–10 分鐘對話)中,GPT-Live-1 與 GPT-Live-1 mini 在整體偏好、輪流發言、插話、流暢度及自然程度上均顯著優於進階語音模式。基準測試同樣亮眼:
- GPQA(生物、化學、物理專家推理)大幅優於進階語音模式
- BrowseComp(代理式網路搜尋)有顯著提升
- τ³-Voice Telecom(多輪電信客服任務)表現更優
關鍵要點
- 全雙工核心:同時聆聽與說話,不依賴靜音觸發,避免不自然插話
- 模型版本:GPT-Live-1(Plus/Pro/Go 用戶)與 GPT-Live-1 mini(免費用戶),API 即將開放
- 視覺化卡片:語音對話中可顯示天氣、股票、體育等豐富視覺資訊
- 安全設計:音訊原生評估、即時防護措施、青少年保護、情感依賴長期監控
- 已知限制:發布時不支援影片/螢幕分享語音;部分語言帶有非母語口音
實務應用
每週已有超過 1.5 億人透過 ChatGPT 語音互動。GPT-Live 的使用場景包括:無手操作的日常協助(通勤、烹飪)、語言學習練習、長達 30-40 分鐘的深度諮詢對話。選擇推理強度(即時 / 中 / 高)讓使用者可在速度與深度之間切換。
相關頁面:Hugging Face × Cerebras:以 Gemma 4 打造實時語音 AI 堆棧 | Reachy Mini 本地化對話:語音 AI 管線的離線部署實錄
延伸觀點
語音將成為下一個主要計算介面(TechCrunch、MarkTechPost 共同指出):OpenAI 明確將語音定位為「複雜工作的主要計算介面」,不只是問答工具。委派架構讓語音 AI 首次能處理需要搜尋與推理的長任務,同時維持對話流暢——這是之前所有語音系統無法做到的。
競爭格局加速成形(TechCrunch):Apple Siri 與 Amazon Alexa 也正同步升級對話自然度與上下文處理。新創公司 Sesame 亦以自然對話體驗為主打切入市場。全雙工語音正從差異化優勢快速演變為行業基準。
語言支援仍是短板(TechCrunch):GPT-Live 在英語以外的語言(如印地語)仍帶有美國口音,發音自然度不足。OpenAI 承認需要進一步最佳化各語言體驗——對非英語市場用戶而言,這是現階段的明顯限制。
反向連結
以下頁面引用了本頁: