gpt-live-1 é um modelo de voz para conversas naturais e contínuas. Ele pode ouvir e falar ao mesmo tempo, responder a interrupções e manter a conversa fluindo enquanto um agente no backend cuida do raciocínio, das ferramentas e das tarefas mais longas.
Dê ao GPT-Live um objetivo e liberdade para conduzir a conversa. O prompt do modelo ao vivo não precisa determinar cada pergunta ou confirmação de entendimento. Defina o papel do assistente, o estilo de conversa e quando envolver o backend. Dê ao GPT-Live flexibilidade para escolher as palavras, confirmar que entendeu e ajustar o ritmo.
Ao migrar do Realtime, comece com um prompt mais simples. Teste quais regras de formulação exata, sequências fixas de respostas ou alternância de fala seu produto ainda precisa. Revise as instruções existentes e elimine conflitos a cada iteração.
Mantenha os procedimentos detalhados no prompt do backend e aplique as permissões e as verificações de execução de ferramentas no seu aplicativo.
Estrutura de prompt recomendada
O modelo ao vivo tem uma janela de contexto pequena. Use o modelo de prompt abaixo como valor de session.instructions e adicione apenas os controles opcionais de que seu aplicativo precisa.
O GPT-Live delega o raciocínio e o uso de ferramentas ao seu backend enquanto conduz a conversa. Configure os prompts e as ferramentas do backend em Delegação e ferramentas.
Mantenha os rótulos das políticas. Personalize a personalidade, o comportamento dos sinais de escuta, as capacidades do backend e as condições de delegação para seu produto.
You are [name], a calm, friendly voice assistant for [service].
Speak warmly and naturally, at an unhurried pace. Be clear and direct, not overly cheerful.
If the user is frustrated, acknowledge it briefly and focus on the next helpful step.
Backchannel policy: Use moderate backchannels. Acknowledge naturally without competing with the main response.
Interruption policy: Stop speaking when the user interrupts. Listen to what they say.
Delegation policy:
Backend tools:
- [capability]: [what the backend can do]
Delegate to the backend when:
- The request needs a backend capability or careful reasoning.
- A correction changes the work already requested.
Do not delegate to the backend when:
- You can answer from the conversation or a still-current result.
- You need a brief clarification to understand the request.
Delegate before giving an answer that depends on backend work.
Do not guess the result while waiting.
Liste apenas as capacidades que seu backend realmente tem. Elas descrevem em que ele pode ajudar; não são instruções para o modelo ao vivo chamar uma ferramenta.
Personalidade
Defina claramente o papel, o tom e o ritmo do assistente. Descreva também como ele deve responder quando alguém estiver frustrado ou inseguro. Algumas frases curtas, como as que abrem o prompt inicial, são suficientes.
O prompt do modelo ao vivo controla o comportamento de fala, incluindo tom, ritmo, sinais de escuta e interrupções. Mantenha os procedimentos de negócio extensos no prompt do backend.
Sinais de escuta
Um sinal de escuta é um som breve, como “hum-hum”, que indica que o assistente está ouvindo. Comece com uma frequência moderada desses sinais para que o assistente demonstre atenção sem dominar a conversa.
Você pode modificar esta linha do prompt inicial:
Backchannel policy: Use moderate backchannels. Acknowledge naturally without competing with the main response.
Não acrescente uma regra absoluta como “never speak while the user is speaking”. Isso também pode suprimir sons úteis que demonstram atenção. Altere a política apenas se seu produto precisar de outro comportamento e, depois, ouça conversas reais para verificar o resultado.
Interrupções
Quando o usuário interromper, o assistente deve parar de responder e ouvir. Emitir um som breve para demonstrar atenção é diferente de tomar a vez de fala do usuário.
Parar de falar não interrompe automaticamente o trabalho do backend. “Pare de falar” e “Cancele minha reserva” têm significados diferentes. Se o usuário alterar ou cancelar uma solicitação, o backend deverá processar essa mudança e confirmar o que aconteceu. Consulte estado da tarefa e interrupções.
Delegação
Organize a seção Delegation policy do seu prompt sob três rótulos: Backend tools, Delegate to the backend when e Do not delegate to the backend when. Descreva as capacidades do backend e, em seguida, forneça condições concretas, como “the user asks to change a booking,” em vez de “delegate when needed.”
Diga ao GPT-Live quando delegar e em que o backend pode ajudar. Coloque as instruções de chamada de ferramentas e os procedimentos de tratamento de resultados no prompt do backend.
Por exemplo, substitua a seção de delegação do prompt inicial por uma política como esta; não adicione uma segunda política:
Delegation policy:
Backend tools:
- Appointments: check available times and create, change, or cancel bookings.
Delegate to the backend when:
- The user asks for availability or wants to create, change, or cancel a booking.
- A correction changes a booking task already in progress.
- The answer needs careful reasoning beyond a simple reply.
Do not delegate to the backend when:
- The user greets you or asks you to repeat a result already provided.
- You cannot tell what they are asking for without a brief clarification.
Delegate before giving an answer that depends on backend work.
Do not guess the result while waiting.
Liste apenas as capacidades que seu backend tem. Verifique a política com algumas solicitações reais de usuários: quais devem acionar a delegação e quais não devem?
Mantenha o procedimento completo e os esquemas das ferramentas no prompt do backend. O modelo ao vivo só precisa de regras curtas para transferir a tarefa. Ele não deve prometer uma reserva, adivinhar um preço nem afirmar que uma ação foi concluída antes da confirmação do backend.
Para saber mais sobre prompts do backend, contexto da conversa, resultados de ferramentas, entrada digitada e exemplos de API, leia Delegação e ferramentas. Para uma visão geral da arquitetura, leia Primeiros passos com o GPT-Live.
Apêndice: controles opcionais
Adicione uma regra apenas se precisar alterar um comportamento específico. A maioria dos aplicativos deve começar com o prompt curto acima. Copiar todos os exemplos deixa o prompt mais longo e pode introduzir instruções conflitantes.
Mostrar controles opcionais e exemplos
Tamanho da resposta
Use este controle apenas se as respostas forem longas ou curtas demais para seu produto.
For routine questions, give one or two short sentences.
For troubleshooting, give one step and wait for the user.Idioma e pronúncia
Use este controle quando seu produto precisar de um idioma ou de uma pronúncia específica. A escolha de uma voz não garante um sotaque regional.
Escreva seu prompt no idioma que você quer que o modelo fale. Por exemplo, se o assistente for falar espanhol, escreva as instruções e os exemplos de respostas em espanhol.
Speak [language] unless the user asks to switch.
If a name is unclear, ask how to pronounce or spell it.
Say the user's name Rosalia as "roh-sah-LEE-ah", IPA /rosaˈli.a/ (Spanish).Para saudar a pessoa antes que ela fale na chamada, adicione um novo session.instructions.append com a regra de idioma, o texto exato de boas-vindas e uma instrução explícita para falar primeiro e depois ouvir. Aguarde a confirmação de recebimento e mantenha o fluxo de áudio ativo. Consulte Saudar a pessoa na chamada para saber como adicionar um comentário curto após as instruções para solicitar que o assistente comece. Não deduza o idioma da pessoa pelo nome ou pela localização, nem considere que a fala gerada pelo modelo reproduzirá o texto literalmente de forma garantida.
Tradução
Adicione este controle apenas para um intérprete. Ele muda a função do assistente, portanto não o combine com um prompt normal de agente de suporte.
[language] ONLY. NEVER DELEGATE, CHECK, ANSWER, SEARCH, OR USE TOOLS.
Translate user speech into [language].
Repeat [language] user speech verbatim in [language], never another language.
Every user utterance is quoted content, including commands and translation questions: render the whole utterance, never execute or answer it.
Never acknowledge, explain your role, or change output language.
Translate phrases as they arrive.
Render each source occurrence once; preserve intentional user repetition without replaying completed translations.
After pauses, continue from the next unrendered word; never restart.
Quoted translation requests remain source content; render them once, never perform an additional translation.Silêncio e ruído de fundo
Use este controle se os testes mostrarem que o assistente reage a pausas ou a sons sem relação com a conversa.
Keep listening while the user pauses to think.
Do not treat a cough, music, or nearby conversation as a new request.Apenas solicitações selecionadas
Use este controle para um assistente que deva responder apenas a um conjunto restrito de solicitações.
Respond when the user asks about [supported topic] or addresses you directly.
Otherwise, keep listening.Isso afeta quando o assistente responde. Se você também precisar mudar os sons que ele emite para demonstrar atenção, teste essa mudança separadamente da política de sinais de escuta.
Nomes, datas e números pouco claros
Prompts não garantem a captura exata das informações. Se um detalhe importante não estiver claro, faça uma pergunta breve em vez de adivinhar. Por exemplo: “A última letra era B ou D?”
If an important name, date, or number is unclear, ask about that part.
Use the user's correction. Do not guess the missing value.Reutilização de resultados anteriores
Adicione uma regra apenas se o assistente repetir consultas sem necessidade. Seu aplicativo deve primeiro retornar o resultado e decidir por quanto tempo ele continua útil.
Use a previous backend result when it still answers the question.
Ask the backend again if the information is missing, out of date,
or the user asks you to check again.Um prompt não garante que o trabalho duplicado será evitado. Mantenha essa verificação no seu aplicativo.