For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegación principal

Modo rápido

Obtén velocidades hasta 2,5× mayores en la API.

El modo rápido ofrece velocidades hasta 2,5× mayores y una latencia más constante, manteniendo la flexibilidad del pago por uso. El modo rápido es ideal para aplicaciones de alto valor orientadas al usuario con tráfico regular en las que la latencia es fundamental.

El procesamiento prioritario pasó a llamarse modo rápido el 30 de julio de 2026. También aumentamos la velocidad del modo rápido para gpt-5.6-sol, que ahora es hasta 2,5× más rápido que el procesamiento estándar. Puedes usar tanto service_tier: "priority" como service_tier: "fast" en tus solicitudes a la API para acceder a esta funcionalidad.

Configurar el modo rápido

Puedes configurar las solicitudes a la API Responses o a la API para completar chats para que usen el modo rápido mediante un parámetro de la solicitud o una opción de configuración del proyecto.

Para activar el modo rápido en una solicitud individual, establece el parámetro service_tier en fast. Establecer service_tier en priority produce el mismo comportamiento en los modelos compatibles.

Crear una respuesta con el modo rápido
from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-5.6-sol",
    input="What does 'fit check for my napalm era' mean?",
    service_tier="fast",
)
print(response)

Para activarlo a nivel de proyecto, abre Configuración, selecciona General en Proyecto y cambia Nivel de servicio del proyecto a Rápido. Las solicitudes que no especifiquen un valor de service_tier usarán entonces el modo rápido de forma predeterminada. Las solicitudes del proyecto pasarán gradualmente al modo rápido con el tiempo.

El campo service_tier del objeto de respuesta de Responses o Chat Completions identifica el nivel usado para procesar la solicitud. Para GPT-5.6 y los modelos anteriores, la respuesta devuelve priority tanto si la solicitud especifica priority como si especifica fast.

Límites de solicitudes y ritmo de aumento del tráfico

Límites básicos

El consumo del modo rápido cuenta para los límites de solicitudes de la misma manera que el procesamiento estándar. Usa tu lógica habitual de reintentos y espera entre cada intento. Para un modelo determinado, el procesamiento estándar y el modo rápido comparten el mismo límite de solicitudes.

Límite del ritmo de aumento del tráfico

Si tu tráfico aumenta demasiado rápido, el sistema puede procesar algunas solicitudes del modo rápido a velocidades estándar y cobrar las tarifas estándar. Cuando esto sucede, la respuesta contiene service_tier: "default". Como regla general, una vez que tu tráfico alcance 1 millón de tokens de entrada por minuto (TPM), auméntalo como máximo un 50 % cada 15 minutos. El punto exacto en el que se aplica el límite del ritmo de aumento puede variar según el modelo y las condiciones del tráfico.

Para evitar que se active el límite del ritmo de aumento del tráfico:

  • Aumenta el tráfico gradualmente al cambiar de modelo o de versión.
  • Usa indicadores de funcionalidades para transferir el tráfico a lo largo de varias horas, no de forma instantánea.
  • Evita ejecutar trabajos grandes de extracción, transformación y carga (ETL) o de procesamiento por lotes en el modo rápido.

Consideraciones de uso

  • El modo rápido cobra un recargo por token respecto del procesamiento estándar. Consulta la página de precios para ver los detalles y los modelos compatibles.
  • Los descuentos por entradas en caché siguen aplicándose a las solicitudes del modo rápido.
  • El modo rápido admite solicitudes multimodales, incluidas las imágenes de entrada.
  • Para ver las solicitudes del modo rápido en el panel de uso, selecciona la opción de agrupar por nivel de servicio. Para GPT-5.6 y los modelos anteriores, estas solicitudes aparecen como priority incluso cuando especificas fast.
  • Los modelos GPT-5.6 admiten contextos largos. El modo rápido no admite modelos con ajuste fino ni embeddings.

Preguntas frecuentes

Para obtener información sobre cuentas y políticas, consulta las preguntas frecuentes sobre el modo rápido.

¿El modo rápido está disponible en todas las regiones?

La disponibilidad depende de las leyes y regulaciones de cada jurisdicción. Comunícate con tu director de cuenta si tienes preguntas sobre la disponibilidad en tu región.

¿Cómo interactúa el modo rápido con el nivel de capacidad?

El nivel de capacidad y el modo rápido son independientes. Las solicitudes del modo rápido se facturan por separado y no consumen los paquetes de TPM adquiridos del nivel de capacidad. El tráfico que excede el nivel de capacidad no pasa automáticamente al modo rápido.

¿Cómo se factura el modo rápido?

El modo rápido cobra un recargo por token respecto del procesamiento estándar. Todos los modos de procesamiento cuentan para tu compromiso de gasto anual para empresas, y los tokens de entrada en caché que cumplen los requisitos reciben los mismos descuentos disponibles para el procesamiento estándar.

Para GPT-5.6 Sol, el modo rápido cuesta el doble de la tarifa estándar correspondiente. Las solicitudes con contexto corto cuestan $8 por cada millón de tokens de entrada y $40 por cada millón de tokens de salida; las solicitudes con contexto largo cuestan $16 por cada millón de tokens de entrada y $60 por cada millón de tokens de salida. Los precios promocionales de GPT-5.6 Sol están disponibles al menos hasta el 21 de noviembre de 2026. Consulta los detalles de precios.

Para revisar el uso, abre el panel de uso, selecciona Responses o Chat Completions y agrupa por nivel de servicio. Para revisar los costos, agrupa por concepto.

¿Qué modelos y modalidades admiten el modo rápido?

El modo rápido admite las capacidades multimodales disponibles con el procesamiento estándar, incluidas las imágenes de entrada. Los modelos GPT-5.6 admiten contextos largos. El modo rápido no admite modelos con ajuste fino ni embeddings. Es posible que los futuros modelos GPT admitan el modo rápido, pero no se garantiza la compatibilidad para todos los modelos.

¿Los límites del ritmo de aumento del tráfico se comparten entre proyectos u organizaciones?

Sí. Todo tu tráfico cuenta para el mismo límite del ritmo de aumento. Si alcanzas estos límites con frecuencia, considera adquirir una cuota del nivel de capacidad.

¿Qué sucede si el modo rápido no cumple su objetivo de latencia?

El modo rápido para GPT-6 Astra no incluye un SLA de latencia. Para GPT-5.6 y los modelos anteriores, el modo rápido y el nivel de capacidad reciben el mismo tratamiento en cuanto a los acuerdos de nivel de servicio, y los acuerdos para empresas que cumplen los requisitos pueden otorgar créditos de servicio cuando no se cumplen los objetivos de latencia. Comunícate con tu director de cuenta si tienes preguntas o inquietudes.

¿El modo rápido es compatible con la residencia de datos, la retención cero de datos y un BAA?

El modo rápido es compatible con la residencia de datos, la retención cero de datos y un acuerdo de asociado comercial (BAA), sujeto a la disponibilidad específica de cada modelo. GPT-6 Astra no admite el modo rápido con residencia de datos en la UE. Siguen aplicándose los requisitos existentes de puntos de acceso, herramientas, elegibilidad y contratos. Consulta la guía Tus datos para obtener más detalles.