For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegación principal

Audio y voz

Empieza con GPT-Live para conversaciones por voz o elige una API para otra tarea de audio.

Para una nueva aplicación de conversaciones por voz, empieza con GPT-Live. Puede escuchar mientras habla y mantener la conversación en marcha mientras un agente del backend razona, usa herramientas o completa una tarea.

Conecta tu primera conversación con la guía de inicio rápido de WebRTC y luego escribe un prompt breve para Live. Si ya tienes una aplicación de Realtime o un agente de texto, sigue la guía Migrar a GPT-Live.

Elige otro flujo de trabajo de audio

Usa la Realtime API cuando necesites su modelo de sesiones y herramientas. Para transcripción, traducción o generación de voz sin un agente conversacional, elige la API dedicada que corresponda a continuación.

Qué desarrollarEmpieza aquíQué controlas
Un agente de voz a voz que usa el modelo de sesiones y herramientas de RealtimeRealtime APITurnos de audio, estado de la sesión, herramientas e interrupciones.
Una interfaz de voz para un agente de texto existenteAgentes de vozConversión de voz a texto, el flujo de trabajo del agente de texto y, después, conversión de texto a voz.
Una transcripción de un archivo de audioTranscripción de archivosCarga de archivos, solicitudes acotadas y formatos de transcripción compatibles.
Subtítulos en vivo sin que el asistente hableTranscripción en vivoAudio en transmisión continua y eventos de transcripción incremental.
Traducción continua de vozTraducción en vivoUna sesión dedicada a la traducción, no un bucle de turnos de un agente de voz.
Narración o voz generadaTexto a vozTexto, voz y formato de salida.
Entrada o salida de audio en una aplicación de chat existenteAudio en Chat CompletionsSolicitudes acotadas de chat multimodal.

Desarrollar con voz

Consulta Agentes de voz para comparar arquitecturas. Empieza con la guía de diseño de prompts para GPT-Live o Realtime. Luego consulta las guías compartidas de voces personalizadas, evaluación y optimización de costos. Cada guía distingue el comportamiento específico de cada modelo o API.

Elige una conexión

Para audio en el navegador, empieza con WebRTC. Para flujos de procesamiento de audio en el servidor, usa WebSockets. Para llamadas telefónicas, consulta Telefonía y SIP. Una conexión de control del lado del servidor permite que un backend de confianza observe y controle una sesión multimedia.

Selecciona tu API en cada página de conexión. Compartir un transporte no hace que los procesos de negociación de conexión, las credenciales ni los formatos de eventos de GPT-Live y Realtime sean intercambiables. Consulta los requisitos previos y las instrucciones de configuración en la guía de conexión.

Agrega audio a tu aplicación existente

Los ejemplos de Chat Completions ahora se encuentran en Audio en Chat Completions. Para empezar a desarrollar un agente de voz en el navegador, usa la guía de inicio rápido de GPT-Live con WebRTC.