For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主导航

GPT-Live 入门

构建语音对话,让对话在后端智能体执行任务时仍能继续。

GPT-Live 负责语音对话,后端智能体则负责查找信息、使用工具和完成任务。它可以一边说话一边聆听,这种能力称为 全双工。将工作交给后端称为 委派:后端执行工作期间,对话仍可继续。

例如,用户可以询问订单情况,在后端查询订单状态时补充细节,并在结果就绪后听取结果。您可以独立于语音模型选择后端模型或智能体;Realtime 则使用同一个模型处理语音、推理和工具选择。

了解两个组成部分

  • GPT-Live 负责对话。 它聆听、说话,并决定何时向后端寻求帮助。请为它提供简短的提示,说明对话风格和委派时机。
  • 后端负责处理委派的任务。 使用 Responses 委派时,请选择受支持的 Responses 模型。使用客户端委派时,可连接您的应用运行的任何模型、智能体执行框架或服务。后端进行推理、使用工具,并返回结果,由 GPT-Live 传达。请将详细指令、业务规则和工具工作流放在后端。

您的应用负责管理权限、确认、私有函数执行和持久化任务状态。打断语音不会自动取消后端工作。请参阅语音智能体,比较 GPT-Live、Realtime 和链式语音应用。

选择后端运行方式

如果托管后端符合需求,请从 Responses 委派 开始:GPT-Live 调用您配置的 Responses 模型,提供对话上下文,并返回结果。如果您的应用需要控制后端执行、上下文或传给 GPT-Live 的结果,请选择 客户端委派

有关比较和配置详情,请参阅选择委派模式。请在创建会话时选择模式;如需更改模式,请启动新会话。

连接您的第一个会话

请从GPT-Live WebRTC 快速入门开始。其中的浏览器和服务器示例连接了麦克风输入与扬声器输出,并使用支持网页搜索的 Responses 后端。

您需要一个麦克风、一个通过 HTTPS 或 localhost 提供的浏览器页面,以及一台持有 OpenAI 项目 API 密钥的可信服务器。请将密钥保留在服务器上。

  1. 编写简短的对话提示,告诉 GPT-Live 何时向后端寻求帮助。
  2. 按照快速入门指南连接浏览器的麦克风、音频播放和事件通道。您的服务器负责创建会话,并将浏览器的连接提议换取应答。
  3. 等待 session.started,然后说话并听取回复。提出一个需要最新信息才能回答的问题,试用网页搜索后端。
  4. 结束对话并关闭会话,以收集最终用量并释放连接。

请检查语音对话和后端结果。会话启动事件可确认启动成功;听取回复和检查搜索结果则分别验证应用的不同部分。

GPT-Live 语音会话按时长计费,以秒为单位。当前费率请参阅模型定价。后端模型和工具用量单独计费。有关用量核算和降低成本的方法,请参阅成本优化

选择连接方式

  • WebRTC 适用于浏览器语音应用。媒体轨道传输音频,数据通道传输 JSON 事件。
  • WebSockets 适用于服务端音频集成。主套接字传输音频和控制事件。
  • 服务端控制 用于让后端访问现有会话。旁路连接传输事件,音频仍通过主连接传输。
  • 电话与 SIP 介绍电话集成路径并提供服务商相关指南。

合作伙伴集成

对于使用 LiveKitTwilioTelnyxDaily/Pipecat 构建的应用,请先阅读合作伙伴集成概览,为您现有的媒体传输路径选择连接方式。

继续开发