For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegação principal

Primeiros passos com o GPT-Live

Crie uma conversa por voz que continua enquanto um agente de backend trabalha.

O GPT-Live conduz uma conversa por voz enquanto um agente de backend consulta informações, usa ferramentas e conclui tarefas. Ele pode ouvir enquanto fala, uma capacidade chamada full duplex. O envio de tarefas ao backend é chamado de delegação: a conversa pode continuar enquanto essas tarefas são executadas.

Por exemplo, um usuário pode perguntar sobre um pedido, acrescentar um detalhe enquanto o backend verifica o status e ouvir o resultado quando estiver pronto. Você escolhe o modelo ou agente de backend independentemente do modelo de voz; o Realtime usa um único modelo para fala, raciocínio e seleção de ferramentas.

Entenda as duas partes

  • O GPT-Live conduz a conversa. Ele ouve, fala e decide quando pedir ajuda ao backend. Forneça um prompt curto que defina o estilo da conversa e quando delegar.
  • O backend executa as tarefas delegadas. Com a delegação via Responses, use um modelo compatível com a Responses. Com a delegação via cliente, conecte qualquer modelo, harness de agente ou serviço que sua aplicação execute. O backend raciocina, usa ferramentas e retorna resultados para o GPT-Live comunicar. Mantenha aqui as instruções detalhadas, as regras de negócio e os fluxos de trabalho com ferramentas.

Sua aplicação é responsável pelas permissões, pelas confirmações, pela execução de funções privadas e pelo estado persistente das tarefas. Interromper a fala não cancela automaticamente o trabalho do backend. Consulte Agentes de voz para comparar o GPT-Live com o Realtime e com aplicações de voz encadeadas.

Escolha como executar o backend

Comece com a delegação via Responses quando um backend gerenciado atender às suas necessidades: o GPT-Live chama o modelo Responses configurado, fornece o contexto da conversa e retorna os resultados. Escolha a delegação via cliente quando sua aplicação precisar controlar a execução do backend, o contexto ou quais resultados chegam ao GPT-Live.

Consulte Escolha um modo de delegação para ver a comparação e os detalhes de configuração. Escolha o modo ao criar a sessão; para mudar de modo, inicie uma nova sessão.

Conecte sua primeira sessão

Comece pelo guia de início rápido de WebRTC com o GPT-Live. O exemplo de navegador e servidor conecta a entrada do microfone e a saída dos alto-falantes, com um backend Responses capaz de pesquisar na Web.

Você precisa de um microfone, uma página no navegador servida por HTTPS ou localhost e um servidor confiável com uma chave de API de projeto da OpenAI. Mantenha a chave no servidor.

  1. Escreva um prompt de conversa curto que diga ao GPT-Live quando pedir ajuda ao backend.
  2. Siga o guia de início rápido para conectar o microfone, a reprodução de áudio e o canal de eventos do navegador. Seu servidor cria a sessão e troca a oferta de conexão do navegador por uma resposta.
  3. Aguarde session.started, depois fale e ouça uma resposta. Faça uma pergunta que exija informações atuais para experimentar o backend de pesquisa na Web.
  4. Encerre a conversa e feche a sessão para coletar os dados finais de uso e liberar a conexão.

Verifique tanto a conversa por voz quanto o resultado do backend. Um evento de início de sessão confirma a inicialização; ouvir uma resposta e verificar o resultado da pesquisa validam partes distintas da aplicação.

As sessões de voz do GPT-Live são cobradas por segundo, de acordo com a duração. Consulte os preços do modelo para ver a tarifa atual. O uso do modelo de backend e das ferramentas é cobrado separadamente. Consulte Otimização de custos para saber como o uso é contabilizado e como reduzir custos.

Escolha uma conexão

  • WebRTC para aplicações de voz no navegador. As trilhas de mídia transportam áudio; um canal de dados transporta eventos JSON.
  • WebSockets para integrações de áudio do lado do servidor. O socket principal transporta áudio e eventos de controle.
  • Controles do lado do servidor para acesso do backend a uma sessão existente. Uma conexão de banda lateral transporta eventos enquanto o áudio permanece na conexão principal.
  • Telefonia e SIP para opções de integração telefônica e orientações sobre provedores.

Integrações com parceiros

Para aplicações criadas com LiveKit, Twilio, Telnyx ou Daily/Pipecat, comece pela visão geral das integrações com parceiros para escolher uma conexão para o fluxo de mídia existente.

Continue desenvolvendo