For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegación principal

Procesamiento Flex

Optimiza los costos con el procesamiento Flex.

El procesamiento Flex reduce los costos de las solicitudes a Responses o Chat Completions a cambio de tiempos de respuesta más largos y falta ocasional de recursos. Es ideal para tareas fuera de producción o de menor prioridad, como evaluaciones de modelos, enriquecimiento de datos y cargas de trabajo asíncronas.

Los tokens se cobran según las tarifas de la API de procesamiento por lotes, con descuentos adicionales por el almacenamiento de prompts en caché.

El procesamiento Flex está en versión beta y solo está disponible para algunos modelos. Los modelos compatibles se indican en la página de precios.

Uso de la API

Para usar el procesamiento Flex, establece el parámetro service_tier en flex en tu solicitud a la API:

Ejemplo de procesamiento Flex
from openai import OpenAI

client = OpenAI(
    # increase default timeout to 15 minutes (from 10 minutes)
    timeout=900.0
)

# you can override the max timeout per request as well
response = client.with_options(timeout=900.0).responses.create(
    model="gpt-6-astra",
    instructions="List and describe all the metaphors used in this book.",
    input="<very long text of book here>",
    service_tier="flex",
)

print(response.output_text)

Tiempos de espera de las solicitudes a la API

Debido a la menor velocidad del procesamiento Flex, es más probable que se agote el tiempo de espera de las solicitudes. Ten en cuenta lo siguiente para manejar estos casos:

  • Tiempo de espera predeterminado: el tiempo de espera predeterminado es de 10 minutos al realizar solicitudes a la API con un SDK oficial de OpenAI. Es posible que debas aumentarlo para prompts extensos o tareas complejas.
  • Configuración de los tiempos de espera: cada SDK ofrece un parámetro para aumentar este tiempo de espera. En los SDK de Python y JavaScript, este parámetro es timeout, como se muestra en los ejemplos de código anteriores.
  • Reintentos automáticos: los SDK de OpenAI reintentan automáticamente dos veces las solicitudes que devuelven el código de error 408 Request Timeout antes de lanzar una excepción.

Errores por falta de recursos disponibles

En ocasiones, el procesamiento Flex puede no contar con suficientes recursos para atender tus solicitudes, lo que genera el código de error 429 Resource Unavailable. No se te cobrará cuando esto ocurra.

Considera implementar estas estrategias para manejar los errores por falta de recursos disponibles:

  • Reintenta las solicitudes con espera exponencial: implementar una espera exponencial es adecuado para cargas de trabajo que toleran demoras y busca minimizar los costos, ya que tu solicitud puede completarse cuando haya más capacidad disponible. Para obtener detalles de implementación, consulta este cookbook.

  • Reintenta las solicitudes con procesamiento estándar: cuando recibas un error por falta de recursos disponibles, implementa una estrategia de reintentos con procesamiento estándar si, para tu caso de uso, vale la pena asumir costos ocasionalmente más altos para garantizar que la solicitud se complete correctamente. Para hacerlo, establece service_tier en auto en la solicitud que reintentes, o elimina el parámetro service_tier para usar el modo predeterminado del proyecto.