Hay varias formas de reducir los costos al usar modelos de OpenAI. El costo y la latencia suelen estar relacionados; reducir la cantidad de tokens y solicitudes generalmente acelera el procesamiento. La Batch API y el procesamiento Flex de OpenAI son otras opciones para reducir los costos.
Costo y latencia
Para reducir la latencia y el costo, considera las siguientes estrategias:
- Reduce las solicitudes: limita la cantidad de solicitudes necesarias para completar las tareas.
- Minimiza los tokens: reduce la cantidad de tokens de entrada y optimiza las respuestas del modelo para que sean más breves.
- Selecciona un modelo más pequeño: usa modelos que equilibren la reducción de costos y latencia con la conservación de la precisión.
Para conocer más sobre estas estrategias, consulta nuestra guía de optimización de la latencia.
Batch API
Procesa trabajos de forma asíncrona. La Batch API ofrece un conjunto sencillo de puntos de acceso que te permiten reunir varias solicitudes en un solo archivo, iniciar un trabajo de procesamiento por lotes para ejecutarlas, consultar el estado del lote mientras se ejecutan las solicitudes y, finalmente, recuperar los resultados recopilados cuando se complete el lote.
Primeros pasos con la Batch API →
Procesamiento Flex
Obtén costos considerablemente más bajos para las solicitudes de Chat Completions o Responses a cambio de tiempos de respuesta más lentos y falta ocasional de disponibilidad de recursos. Es ideal para tareas fuera de producción o de menor prioridad, como evaluaciones de modelos, enriquecimiento de datos o cargas de trabajo asíncronas.