For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主要導覽

音訊與語音

開發對話式語音應用,請從 GPT-Live 開始;若要處理其他音訊任務,則可選擇適合的 API。

開發新的對話式語音應用程式,請從 GPT-Live 開始。它能一邊說話一邊聆聽,並在後端智慧體進行推理、使用工具或完成任務時,讓對話持續進行。

依照 WebRTC 快速入門建立第一個對話連線,接著撰寫簡短的 Live 提示詞。如果你已有 Realtime 應用程式或文字智慧體,請參閱遷移至 GPT-Live

選擇其他音訊工作流程

若需要 Realtime API 的作業階段與工具模型,請使用 Realtime API。若要進行轉錄、翻譯或語音生成,且不需要對話式智慧體,請選擇下方的專用 API。

開發目標入門指南可控制的項目
使用 Realtime 作業階段與工具模型的語音到語音智慧體Realtime API音訊回合、作業階段狀態、工具及中斷。
現有文字智慧體的語音介面語音智慧體先將語音轉為文字,執行文字智慧體工作流程,再將文字轉為語音。
音訊檔案的轉錄文字檔案轉錄檔案上傳、範圍明確的請求,以及支援的轉錄格式。
不含助理語音的即時字幕即時轉錄串流音訊及增量轉錄事件。
連續語音翻譯即時翻譯專用翻譯作業階段,而非語音智慧體的回合循環。
旁白或生成的語音文字轉語音文字、語音及輸出格式。
現有對話應用程式中的音訊輸入或輸出Chat Completions 中的音訊範圍明確的多模態對話請求。

開發語音應用

透過語音智慧體指南比較架構。先閱讀 GPT-LiveRealtime 的提示詞指南,再參閱自訂語音評估成本最佳化的共用指南。各指南都會區分特定模型或 API 的行為。

選擇連線方式

若要在瀏覽器中使用音訊,請從 WebRTC 開始。伺服器音訊處理流程請使用 WebSockets。電話通話請參閱電話通訊與 SIP伺服器端控制連線可讓受信任的後端觀察並控制媒體作業階段。

請在各連線說明頁面選擇你使用的 API。即使使用相同的傳輸方式,GPT-Live 與 Realtime 的交握程序、憑證或事件格式也不能互換。請參閱連線指南,了解先決條件與設定步驟。

為現有應用程式加入音訊功能

Chat Completions 範例現已移至Chat Completions 中的音訊。若要開始開發瀏覽器語音智慧體,請使用 GPT-Live WebRTC 快速入門