核心概念
OpenAI 於 2026 年 9 月將 GPT‑Live‑1 帶入 API,將 ChatGPT 式的自然、全雙工語音互動交給開發者。它的重點不是單純「更像真人的聲音」,而是把持續聆聽、說話、判斷插話時機與背景任務委派整合為同一個即時互動層;需要深度推理或工具呼叫時,再委派給後端文字模型。這延續 OpenAI 語音智慧躍升:GPT-Realtime-2 三模型解析 所代表的即時語音路徑,但更著重完整代理工作流。
技術亮點:從串接管線到全雙工協作
傳統語音代理通常串接 STT → LLM → TTS。每次交接都增加延遲,也容易在使用者停頓、插話或改口時遺失節奏。GPT‑Live‑1 以單一模型同時推理輸入與輸出音訊,能即時處理打斷、簡短附和、沉默與環境噪音;原文稱 Speak 的早期語言學習評估中,這使不必要打斷比先前回合式系統少近八成。
模型並非包辦所有工作:前端語音層維持對話節奏,後端可依任務接入 GPT‑6 Astra 或第三方模型進行推理與工具呼叫。開發者可為高量、規則較明確的預約/訂單查詢配較輕的後端,將複雜客服升級至較強推理模型。這種分層與 GPT-6 Astra:新一代智慧、電腦操作與負責任部署 的工具型能力互補,也讓成本、速度與品質能按任務拆開管理。
API 能力與評估訊號
GPT‑Live‑1 提供原生 ASR 逐字稿與回覆文字、字母數字辨識、關鍵字偏置及回合偵測,因此既能採全雙工互動,也能相容仍以明確回合邊界建構的產品。OpenAI 報告其在 Full Duplex Bench 比 GPT‑Realtime‑2.1 高 30 個百分點;與 GPT‑6 Astra(medium reasoning)搭配時,在衡量端到端語音代理任務的 Tau3 名列第一。這些是供應商評測,導入前仍應以自家口音、噪音、打斷率、任務完成率及人工轉接率重做驗證。
語音選項擴及更多口音、方言與語言,並支援電話部署;原文列舉餐廳訂位與客服為例。價格為前端語音層每分鐘 0.05 美元,後端模型、工具與 agent harness 另計。對企業而言,真正的成本單位不應只是每分鐘,而是「可完成且可安全交付的一次任務」:需將重試、轉接、人員覆核與失敗處理一起納入。
實務意義:自然不等於可放手
更流暢的全雙工體驗會放大語音代理的使用範圍,尤其是電話與長時段對話;但它也提高代理在未完成任務前持續說話、誤解上下文或過早採取行動的風險。若系統能連公司工具,應沿用 Parloa——企業語音 AI 客服代理管理平台 所強調的治理原則:清楚揭露身分、限制工具權限、將高風險動作設為核准制、保留可稽核逐字稿,並在信心不足時交由真人。OpenAI Presence 的定位也相同:可回答、查詢與採取「已核准」動作,但仍須能升級給人員。
與既有知識的連結
- GPT-Live:OpenAI 全雙工語音模型:既有頁面記錄了全雙工與委派式推理的產品脈絡;本次更新補上 API 的控制面、價格與可部署能力。
- Hugging Face × Cerebras:以 Gemma 4 打造實時語音 AI 堆棧:可對照開放堆棧在低延遲、模型選型與部署控制上的取捨。
- OpenAI 語音 AI 低延遲架構:WebRTC 大規模部署實錄:全雙工互動的體感同時依賴模型與網路傳輸;端到端延遲不可只看模型基準。
來源
- OpenAI(2026-09-10),〈Build more natural voice experiences with GPT‑Live‑1 in the API〉:https://openai.com/index/introducing-gpt-live-1-in-the-api
- 原文快照:
raw/articles/openai-gpt-live-1-api-2026-09-10.md
反向連結
以下頁面引用了本頁:
- Hugging Face × Cerebras:以 Gemma 4 打造實時語音 AI 堆棧(文章精選)
- Reachy Mini 本地化對話:語音 AI 管線的離線部署實錄(文章精選)
- GPT-6 Astra:新一代智慧、電腦操作與負責任部署(文章精選)
- OpenAI 語音 AI 低延遲架構:WebRTC 大規模部署實錄(文章精選)
- OpenAI 語音智慧躍升:GPT-Realtime-2 三模型解析(文章精選)
- Parloa——企業語音 AI 客服代理管理平台(文章精選)
- Proaction × Codex:客製化 Demo 與車隊語音代理的銷售閉環(文章精選)
- Ringg × OpenAI:多通路語音代理的成效、路由與治理(文章精選)