For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主导航

音频与语音

构建语音对话应用,从 GPT-Live 开始;处理其他音频任务,请选择相应的 API。

构建新的语音对话应用,请从 GPT-Live 开始。它可以边说边听,并在后端智能体进行推理、使用工具或完成任务时,让对话继续进行。

按照 WebRTC 快速入门建立您的首次对话连接,然后编写一段简短的 Live 提示。如果您已有 Realtime 应用或文本智能体,请按照迁移到 GPT-Live 中的说明操作。

选择其他音频工作流程

如果您需要 Realtime API 的会话和工具模型,请使用该 API。如果您需要转录、翻译或语音生成,但不需要对话智能体,请选择下方的专用 API。

构建目标从这里开始您可以控制的内容
采用 Realtime 会话和工具模型的语音到语音智能体Realtime API音频轮次、会话状态、工具和打断。
现有文本智能体的语音交互界面语音智能体语音转文本、文本智能体工作流程,以及后续的文本转语音。
音频文件的转录文本文件转录文件上传、有明确边界的请求,以及支持的转录格式。
不含助手语音的实时字幕实时转录流式音频和增量转录事件。
连续语音翻译实时翻译专用翻译会话,而非语音智能体的轮次循环。
旁白或生成的语音文本转语音文本、音色和输出格式。
现有聊天应用中的音频输入或输出Chat Completions 中的音频有明确边界的多模态聊天请求。

构建语音应用

参阅语音智能体以比较不同架构。先阅读 GPT-LiveRealtime 的提示词指南,再参考自定义音色评估成本优化的通用指南。各指南均会区分特定模型或 API 的行为。

选择连接方式

处理浏览器音频,请从 WebRTC 开始。构建服务器音频流水线,请使用 WebSockets。处理电话通话,请参阅电话与 SIP服务器端控制连接可让受信任的后端观察并控制媒体会话。

请在各连接页面选择您使用的 API。使用相同的传输方式并不意味着 GPT-Live 和 Realtime 的握手、凭据或事件格式可以互换。有关前提条件和设置说明,请查看连接指南。

为现有应用添加音频功能

Chat Completions 示例现已移至 Chat Completions 中的音频。要开始构建浏览器语音智能体,请参阅 GPT-Live WebRTC 快速入门