For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegación principal

Primeros pasos con GPT-Live

Crea una conversación de voz que continúe mientras un agente del backend trabaja.

GPT-Live se encarga de la conversación de voz mientras un agente del backend busca información, usa herramientas y completa tareas. Puede escuchar mientras habla, una capacidad llamada dúplex completo. Enviar trabajo al backend se denomina delegación: la conversación puede continuar mientras se ejecuta ese trabajo.

Por ejemplo, un usuario puede preguntar por un pedido, agregar un detalle mientras el backend consulta su estado y escuchar el resultado cuando esté listo. Tú eliges el modelo o agente del backend de forma independiente del modelo de voz; Realtime usa un solo modelo para el habla, el razonamiento y la selección de herramientas.

Comprende las dos partes

  • GPT-Live se encarga de la conversación. Escucha, habla y decide cuándo pedir ayuda al backend. Dale un prompt breve que indique el estilo de conversación y cuándo delegar.
  • El backend se encarga de las tareas delegadas. Con la delegación a Responses, usa un modelo compatible con Responses. Con la delegación al cliente, conecta cualquier modelo, arnés de ejecución de agentes o servicio que ejecute tu aplicación. El backend razona, usa herramientas y devuelve resultados para que GPT-Live los comunique. Mantén aquí las instrucciones detalladas, las reglas de negocio y los flujos de trabajo con herramientas.

Tu aplicación se encarga de los permisos, las confirmaciones, la ejecución de funciones privadas y el estado persistente de las tareas. Interrumpir el habla no cancela automáticamente el trabajo del backend. Consulta Agentes de voz para comparar GPT-Live con Realtime y las aplicaciones de voz encadenadas.

Elige cómo ejecutar el backend

Comienza con la delegación a Responses cuando un backend administrado se ajuste a tus necesidades: GPT-Live llama al modelo de Responses que hayas configurado, proporciona el contexto de la conversación y devuelve los resultados. Elige la delegación al cliente cuando tu aplicación necesite controlar la ejecución del backend, el contexto o qué resultados llegan a GPT-Live.

Consulta Elegir un modo de delegación para ver la comparación y los detalles de configuración. Elige el modo al crear la sesión; para cambiar de modo, inicia una sesión nueva.

Conecta tu primera sesión

Comienza con el inicio rápido de GPT-Live con WebRTC. Su ejemplo de navegador y servidor conecta la entrada del micrófono y la salida de los altavoces, con un backend de Responses que puede buscar en la web.

Necesitas un micrófono, una página de navegador servida a través de HTTPS o localhost y un servidor de confianza con una clave de API de un proyecto de OpenAI. Mantén la clave en el servidor.

  1. Escribe un prompt de conversación breve que le indique a GPT-Live cuándo pedir ayuda al backend.
  2. Sigue el inicio rápido para conectar el micrófono, la reproducción de audio y el canal de eventos del navegador. Tu servidor crea la sesión e intercambia la oferta de conexión del navegador por una respuesta.
  3. Espera a que llegue session.started, luego habla y escucha una respuesta. Haz una pregunta que requiera información actualizada para probar el backend de búsqueda web.
  4. Termina la conversación y cierra la sesión para recopilar los datos finales de uso y liberar la conexión.

Comprueba tanto la conversación de voz como el resultado del backend. Un evento de inicio de sesión confirma que esta se inició; escuchar una respuesta y comprobar el resultado de la búsqueda verifican partes distintas de la aplicación.

Las sesiones de voz de GPT-Live se facturan según su duración, por segundo. Consulta los precios del modelo para conocer la tarifa vigente. El uso del modelo del backend y de las herramientas se factura por separado. Consulta Optimización de costos para obtener información sobre cómo se contabiliza el uso y cómo reducir los costos.

Elige una conexión

  • WebRTC para aplicaciones de voz en el navegador. Las pistas multimedia transportan el audio; un canal de datos transporta los eventos JSON.
  • WebSockets para integraciones de audio del lado del servidor. El socket principal transporta el audio y los eventos de control.
  • Controles del lado del servidor para acceder desde el backend a una sesión existente. Una conexión de banda lateral transporta los eventos mientras el audio permanece en la conexión principal.
  • Telefonía y SIP para conocer las opciones de integración telefónica y la orientación sobre proveedores.

Integraciones con socios

Para las aplicaciones desarrolladas con LiveKit, Twilio, Telnyx o Daily/Pipecat, comienza con la descripción general de las integraciones con socios para elegir una conexión para tu ruta multimedia existente.

Sigue desarrollando