For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegação principal

Áudio e voz

Comece com o GPT-Live para conversas por voz ou escolha uma API para outra tarefa de áudio.

Para criar um aplicativo de conversação por voz, comece com o GPT-Live. Ele pode ouvir enquanto fala e manter a conversa em andamento enquanto um agente no backend raciocina, usa ferramentas ou conclui uma tarefa.

Conecte sua primeira conversa com o início rápido de WebRTC e escreva um prompt curto para o Live. Se você já tem um aplicativo Realtime ou um agente de texto, siga o guia Migre para o GPT-Live.

Escolha outro fluxo de trabalho de áudio

Use a Realtime API quando precisar do modelo de sessões e ferramentas que ela oferece. Para transcrição, tradução ou geração de fala sem um agente de conversação, escolha a API dedicada abaixo.

O que criarComece aquiO que você controla
Um agente de fala para fala que usa o modelo de sessões e ferramentas do RealtimeRealtime APITurnos de áudio, estado da sessão, ferramentas e interrupções.
Uma interface de voz para um agente de texto existenteAgentes de vozConversão de fala em texto, o fluxo de trabalho do agente de texto e, depois, conversão de texto em fala.
Uma transcrição de um arquivo de áudioTranscrição de arquivosUploads de arquivos, solicitações com escopo delimitado e formatos de transcrição compatíveis.
Legendas ao vivo sem fala do assistenteTranscrição ao vivoÁudio em streaming e eventos incrementais de transcrição.
Tradução contínua de falaTradução ao vivoUma sessão dedicada à tradução, em vez de um ciclo de turnos de um agente de voz.
Narração ou fala geradaConversão de texto em falaTexto, voz e formato de saída.
Entrada ou saída de áudio em um aplicativo de chat existenteÁudio no Chat CompletionsSolicitações de chat multimodal com escopo delimitado.

Desenvolva com voz

Consulte Agentes de voz para comparar arquiteturas. Comece pelo guia de criação de prompts para GPT-Live ou Realtime. Depois, use os guias compartilhados de vozes personalizadas, avaliação e otimização de custos. Cada guia diferencia os comportamentos específicos de cada modelo ou API.

Escolha uma conexão

Para áudio no navegador, comece com WebRTC. Para pipelines de áudio no servidor, use WebSockets. Para chamadas telefônicas, consulte Telefonia e SIP. Uma conexão de controle do lado do servidor permite que um backend confiável observe e controle uma sessão de mídia.

Selecione sua API em cada página de conexão. Usar o mesmo transporte não torna os procedimentos de negociação de conexão, as credenciais ou os formatos de eventos do GPT-Live e do Realtime intercambiáveis. Consulte o guia de conexão para ver os pré-requisitos e as instruções de configuração.

Adicione áudio ao seu aplicativo existente

Os exemplos de Chat Completions agora estão em Áudio no Chat Completions. Para começar a criar um agente de voz no navegador, use o início rápido de WebRTC com GPT-Live.