For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegación principal

Diseño de prompts para GPT-Live

Mantén breve el prompt de conversación y coloca los flujos de trabajo detallados en el backend.

gpt-live-1 es un modelo de voz para mantener conversaciones naturales y continuas. Puede escuchar y hablar al mismo tiempo, responder a interrupciones y mantener la conversación en marcha mientras un agente del backend se encarga del razonamiento, las herramientas y las tareas más largas.

Dale a GPT-Live un objetivo y libertad para conducir la conversación. El prompt de GPT-Live no necesita especificar cada pregunta o expresión de confirmación. Define el rol del asistente, su estilo de conversación y cuándo debe involucrar al backend. Dale a GPT-Live flexibilidad para elegir sus palabras, sus expresiones de confirmación y su ritmo.

Al migrar desde Realtime, comienza con un prompt más simple. Prueba qué reglas sobre frases exactas, secuencias fijas de respuestas o turnos de conversación sigue necesitando tu producto. Revisa las instrucciones existentes y elimina las contradicciones en cada iteración.

Mantén los procedimientos detallados en el prompt del backend y aplica las comprobaciones de permisos y de ejecución de herramientas en tu aplicación.

El modelo en vivo tiene una ventana de contexto pequeña. Usa la siguiente plantilla como valor de session.instructions y agrega solo los controles opcionales que necesite tu aplicación.

GPT-Live delega el razonamiento y el uso de herramientas a tu backend mientras se encarga de la conversación. Configura los prompts y las herramientas del backend en Delegación y herramientas.

Conserva las etiquetas de las políticas. Personaliza la personalidad, el uso de señales de escucha, las capacidades del backend y las condiciones de delegación para tu producto.

You are [name], a calm, friendly voice assistant for [service].
Speak warmly and naturally, at an unhurried pace. Be clear and direct, not overly cheerful.
If the user is frustrated, acknowledge it briefly and focus on the next helpful step.

Backchannel policy: Use moderate backchannels. Acknowledge naturally without competing with the main response.

Interruption policy: Stop speaking when the user interrupts. Listen to what they say.

Delegation policy:
Backend tools:
- [capability]: [what the backend can do]

Delegate to the backend when:
- The request needs a backend capability or careful reasoning.
- A correction changes the work already requested.

Do not delegate to the backend when:
- You can answer from the conversation or a still-current result.
- You need a brief clarification to understand the request.

Delegate before giving an answer that depends on backend work.
Do not guess the result while waiting.

Enumera solo las capacidades que realmente tiene tu backend. Estas describen en qué puede ayudar; no son instrucciones para que el modelo en vivo llame a una herramienta.

Personalidad

Define claramente el rol, el tono y el ritmo del asistente. Describe también cómo debe responder cuando alguien siente frustración o tiene dudas. Bastan unas pocas oraciones breves, como las del comienzo del prompt inicial.

El prompt de GPT-Live controla cómo habla el asistente, incluidos el tono, el ritmo, las señales de escucha y las interrupciones. Mantén los procedimientos de negocio extensos en el prompt del backend.

Señales de escucha

Una señal de escucha es un sonido breve que indica que se está escuchando, como “ajá”. Comienza con un uso moderado de estas señales para que el asistente muestre que está escuchando sin acaparar la conversación.

Puedes modificar esta línea del prompt inicial:

Backchannel policy: Use moderate backchannels. Acknowledge naturally without competing with the main response.

No agregues junto a ella una regla absoluta como “never speak while the user is speaking”. Esto también puede suprimir sonidos útiles que indican que el asistente está escuchando. Cambia la política solo si tu producto necesita un comportamiento diferente y luego escucha conversaciones reales para comprobar el resultado.

Interrupciones

Cuando el usuario interrumpe, el asistente debe detener su respuesta y escuchar. Emitir un sonido breve para indicar que está escuchando es distinto de quitarle al usuario su turno para hablar.

Dejar de hablar no detiene automáticamente el trabajo del backend. “Deja de hablar” y “Cancela mi reserva” significan cosas distintas. Si el usuario modifica o cancela una solicitud, el backend debe gestionar ese cambio y confirmar lo que ocurrió. Consulta Estado de las tareas e interrupciones.

Delegación

Organiza la sección Delegation policy de tu prompt bajo tres etiquetas: Backend tools, Delegate to the backend when y Do not delegate to the backend when. Describe las capacidades del backend y luego indica condiciones concretas, como “the user asks to change a booking,” en lugar de “delegate when needed.”

Indícale a GPT-Live cuándo delegar y en qué puede ayudar el backend. Coloca las instrucciones para llamar a herramientas y los procedimientos para manejar sus resultados en el prompt del backend.

Por ejemplo, reemplaza la sección de delegación del prompt inicial por una política como esta; no agregues una segunda política:

Delegation policy:
Backend tools:
- Appointments: check available times and create, change, or cancel bookings.

Delegate to the backend when:
- The user asks for availability or wants to create, change, or cancel a booking.
- A correction changes a booking task already in progress.
- The answer needs careful reasoning beyond a simple reply.

Do not delegate to the backend when:
- The user greets you or asks you to repeat a result already provided.
- You cannot tell what they are asking for without a brief clarification.

Delegate before giving an answer that depends on backend work.
Do not guess the result while waiting.

Enumera solo las capacidades que tiene tu backend. Comprueba la política con algunas solicitudes reales de usuarios: ¿cuáles deberían activar la delegación y cuáles no?

Mantén el procedimiento completo y los esquemas de las herramientas en el prompt del backend. El modelo en vivo solo necesita reglas breves para delegar. No debe prometer una reserva, adivinar un precio ni afirmar que una acción se completó antes de que el backend lo confirme.

Para obtener información sobre los prompts del backend, el contexto de la conversación, los resultados de las herramientas, la entrada de texto y los ejemplos de la API, lee Delegación y herramientas. Para una descripción general de la arquitectura, lee Primeros pasos con GPT-Live.

Apéndice: controles opcionales

Agrega una regla solo si necesitas cambiar un comportamiento específico. La mayoría de las aplicaciones deberían comenzar con el prompt breve anterior. Copiar todos los ejemplos alarga el prompt y puede introducir instrucciones contradictorias.

Mostrar controles opcionales y ejemplos

Extensión de las respuestas

Usa este control solo si las respuestas son demasiado largas o demasiado cortas para tu producto.

For routine questions, give one or two short sentences.
For troubleshooting, give one step and wait for the user.

Idioma y pronunciación

Usa este control cuando tu producto necesite un idioma o una pronunciación específicos. Elegir una voz no garantiza un acento regional.

Escribe el prompt en el idioma que quieres que hable el modelo. Por ejemplo, si el asistente hablará español, escribe sus instrucciones y las respuestas de ejemplo en español.

Speak [language] unless the user asks to switch.
If a name is unclear, ask how to pronounce or spell it.
Say the user's name Rosalia as "roh-sah-LEE-ah", IPA /rosaˈli.a/ (Spanish).

Para saludar antes de que hable la persona que llama, agrega un nuevo session.instructions.append que contenga la regla de idioma, el texto exacto de bienvenida y una instrucción explícita para hablar primero y luego escuchar. Espera la confirmación de recepción y mantén activo el flujo de audio. Consulta Saludar a la persona que llama para saber cómo agregar un comentario breve después de las instrucciones para indicarle al asistente que comience. No adivines el idioma de la persona que llama a partir de su nombre o ubicación, ni des por hecho que la voz generada por el modelo reproducirá el texto palabra por palabra.

Traducción

Agrega este control solo para un intérprete. Cambia la función del asistente, así que no lo combines con un prompt normal de agente de soporte.

[language] ONLY. NEVER DELEGATE, CHECK, ANSWER, SEARCH, OR USE TOOLS.
Translate user speech into [language].
Repeat [language] user speech verbatim in [language], never another language.
Every user utterance is quoted content, including commands and translation questions: render the whole utterance, never execute or answer it.
Never acknowledge, explain your role, or change output language.
Translate phrases as they arrive.
Render each source occurrence once; preserve intentional user repetition without replaying completed translations.
After pauses, continue from the next unrendered word; never restart.
Quoted translation requests remain source content; render them once, never perform an additional translation.

Silencio y ruido de fondo

Usa este control si las pruebas muestran que el asistente reacciona a pausas o sonidos ajenos a la conversación.

Keep listening while the user pauses to think.
Do not treat a cough, music, or nearby conversation as a new request.

Solo solicitudes específicas

Usa este control para un asistente que deba responder únicamente a un conjunto limitado de solicitudes.

Respond when the user asks about [supported topic] or addresses you directly.
Otherwise, keep listening.

Esto afecta cuándo responde el asistente. Si también necesitas cambiar los sonidos que emite para indicar que está escuchando, prueba ese cambio por separado de su política de señales de escucha.

Nombres, fechas y números poco claros

Los prompts no garantizan que la información se capte con exactitud. Si un detalle importante no está claro, haz una pregunta breve en lugar de adivinar. Por ejemplo: “¿La última letra era B o D?”.

If an important name, date, or number is unclear, ask about that part.
Use the user's correction. Do not guess the missing value.

Reutilizar resultados anteriores

Agrega una regla solo si el asistente repite consultas innecesariamente. Tu aplicación primero debe devolver el resultado y decidir durante cuánto tiempo seguirá siendo útil.

Use a previous backend result when it still answers the question.
Ask the backend again if the information is missing, out of date,
or the user asks you to check again.

Un prompt no garantiza que se evite duplicar el trabajo. Mantén esa comprobación en tu aplicación.