核心概念

OpenAI 於 2026 年 9 月將 GPT‑Live‑1 帶入 API,將 ChatGPT 式的自然、全雙工語音互動交給開發者。它的重點不是單純「更像真人的聲音」,而是把持續聆聽、說話、判斷插話時機與背景任務委派整合為同一個即時互動層;需要深度推理或工具呼叫時,再委派給後端文字模型。這延續 OpenAI 語音智慧躍升:GPT-Realtime-2 三模型解析 所代表的即時語音路徑,但更著重完整代理工作流。

技術亮點:從串接管線到全雙工協作

傳統語音代理通常串接 STT → LLM → TTS。每次交接都增加延遲,也容易在使用者停頓、插話或改口時遺失節奏。GPT‑Live‑1 以單一模型同時推理輸入與輸出音訊,能即時處理打斷、簡短附和、沉默與環境噪音;原文稱 Speak 的早期語言學習評估中,這使不必要打斷比先前回合式系統少近八成。

模型並非包辦所有工作:前端語音層維持對話節奏,後端可依任務接入 GPT‑6 Astra 或第三方模型進行推理與工具呼叫。開發者可為高量、規則較明確的預約/訂單查詢配較輕的後端,將複雜客服升級至較強推理模型。這種分層與 GPT-6 Astra:新一代智慧、電腦操作與負責任部署 的工具型能力互補,也讓成本、速度與品質能按任務拆開管理。

API 能力與評估訊號

GPT‑Live‑1 提供原生 ASR 逐字稿與回覆文字、字母數字辨識、關鍵字偏置及回合偵測,因此既能採全雙工互動,也能相容仍以明確回合邊界建構的產品。OpenAI 報告其在 Full Duplex Bench 比 GPT‑Realtime‑2.1 高 30 個百分點;與 GPT‑6 Astra(medium reasoning)搭配時,在衡量端到端語音代理任務的 Tau3 名列第一。這些是供應商評測,導入前仍應以自家口音、噪音、打斷率、任務完成率及人工轉接率重做驗證。

語音選項擴及更多口音、方言與語言,並支援電話部署;原文列舉餐廳訂位與客服為例。價格為前端語音層每分鐘 0.05 美元,後端模型、工具與 agent harness 另計。對企業而言,真正的成本單位不應只是每分鐘,而是「可完成且可安全交付的一次任務」:需將重試、轉接、人員覆核與失敗處理一起納入。

實務意義:自然不等於可放手

更流暢的全雙工體驗會放大語音代理的使用範圍,尤其是電話與長時段對話;但它也提高代理在未完成任務前持續說話、誤解上下文或過早採取行動的風險。若系統能連公司工具,應沿用 Parloa——企業語音 AI 客服代理管理平台 所強調的治理原則:清楚揭露身分、限制工具權限、將高風險動作設為核准制、保留可稽核逐字稿,並在信心不足時交由真人。OpenAI Presence 的定位也相同:可回答、查詢與採取「已核准」動作,但仍須能升級給人員。

與既有知識的連結

來源

  • OpenAI(2026-09-10),〈Build more natural voice experiences with GPT‑Live‑1 in the API〉:https://openai.com/index/introducing-gpt-live-1-in-the-api
  • 原文快照:raw/articles/openai-gpt-live-1-api-2026-09-10.md

反向連結

以下頁面引用了本頁: