GPT-Live 負責語音對話,後端智慧體則同時查詢資訊、使用工具並完成任務。它能一邊說話一邊聆聽,這項能力稱為 全雙工。將工作交給後端稱為 委派:後端執行工作時,對話仍可持續進行。
例如,使用者可以詢問訂單,在後端查詢訂單狀態時補充細節,並在結果就緒後聽取回覆。你可以獨立選擇後端模型或智慧體,不受語音模型限制;Realtime 則使用同一個模型處理語音、推理和工具選擇。
了解兩個部分的分工
- GPT-Live 負責對話。 它會聆聽、說話,並決定何時向後端尋求協助。請用簡短的提示詞設定對話風格和委派時機。
- 後端負責處理委派的任務。 使用 Responses 委派時,請選用支援的 Responses 模型。使用用戶端委派時,則可連接應用程式執行的任何模型、智慧體任務執行框架或服務。後端會進行推理、使用工具,並傳回結果,由 GPT-Live 傳達。請將詳細指示、業務規則和工具工作流程放在後端。
你的應用程式負責管理權限、確認、私有函式執行,以及持久保存的任務狀態。打斷語音不會自動取消後端工作。請參閱語音智慧體,比較 GPT-Live、Realtime 和串接式語音應用程式。
選擇後端執行方式
如果託管後端符合需求,可先使用 Responses 委派:GPT-Live 會呼叫你設定的 Responses 模型、提供對話上下文,並傳回結果。如果應用程式需要控制後端執行、上下文,或哪些結果會傳給 GPT-Live,請選擇 用戶端委派。
請參閱選擇委派模式,了解比較結果和組態詳細資訊。建立工作階段時就要選定模式;若要變更模式,請啟動新的工作階段。
連接你的第一個工作階段
從 GPT-Live WebRTC 快速入門開始。其中的瀏覽器與伺服器範例會連接麥克風輸入和喇叭輸出,並搭配可搜尋網頁的 Responses 後端。
你需要麥克風、透過 HTTPS 或 localhost 提供的瀏覽器頁面,以及持有 OpenAI 專案 API 金鑰的可信任伺服器。請將金鑰保留在伺服器上。
- 撰寫簡短的對話提示詞,告訴 GPT-Live 何時向後端尋求協助。
- 依照快速入門指南連接瀏覽器的麥克風、音訊播放和事件通道。你的伺服器會建立工作階段,並將瀏覽器的連線提議送出以取得回應。
- 等待
session.started事件,然後說話並聆聽回覆。提出需要最新資訊才能回答的問題,試用網頁搜尋後端。 - 結束對話並關閉工作階段,以取得最終用量並釋放連線。
請同時檢查語音對話和後端結果。工作階段啟動事件可確認啟動成功;聆聽回覆和檢查搜尋結果,則分別驗證應用程式的不同部分。
GPT-Live 語音工作階段依持續時間按秒計費。目前費率請參閱模型定價。後端模型和工具用量另行計費。請參閱成本最佳化,了解用量計算方式和降低成本的方法。
選擇連線方式
- WebRTC 適用於瀏覽器語音應用程式。媒體軌道傳輸音訊,資料通道則傳輸 JSON 事件。
- WebSockets 適用於伺服器端音訊整合。主要通訊端傳輸音訊和控制事件。
- 伺服器端控制 讓後端存取現有工作階段。帶外連線負責傳輸事件,音訊則仍透過主要連線傳輸。
- 電話通訊與 SIP 提供電話整合方式和供應商相關指引。
合作夥伴整合
如果應用程式是使用 LiveKit、 Twilio、 Telnyx 或 Daily/Pipecat 建置的,請先參閱合作夥伴整合概覽,為現有的媒體傳輸路徑選擇連線方式。
繼續開發
- 參閱GPT-Live 提示詞,設定對話風格和委派行為。
- 參閱委派與工具,連接工具並降低後端延遲。
- 參閱管理工作階段,管理上下文、逐字稿和工作階段生命週期。
- 參閱遷移至 GPT-Live,為你的 Realtime 或文字型智慧體選擇遷移方式。
- 參閱評估語音智慧體,測試對話和任務結果。