Há várias maneiras de reduzir custos ao usar modelos da OpenAI. Custo e latência geralmente estão interligados: reduzir tokens e requisições costuma acelerar o processamento. A API Batch da OpenAI e o processamento Flex são outras formas de reduzir custos.
Custo e latência
Para reduzir a latência e o custo, considere as seguintes estratégias:
- Reduza as requisições: Limite o número de requisições necessárias para concluir tarefas.
- Minimize os tokens: Reduza o número de tokens de entrada e otimize as respostas do modelo para que sejam mais curtas.
- Selecione um modelo menor: Use modelos que equilibrem a redução de custos e latência com a manutenção da precisão.
Para saber mais sobre essas estratégias, consulte nosso guia de otimização de latência.
API Batch
Processe tarefas de forma assíncrona. A API Batch oferece um conjunto simples de endpoints que permitem reunir requisições em um único arquivo, iniciar uma tarefa de processamento em lote para executá-las, consultar o status do lote enquanto as requisições são executadas e recuperar os resultados reunidos quando o lote for concluído.
Primeiros passos com a API Batch →
Processamento Flex
Obtenha custos significativamente menores para requisições de Chat Completions ou Responses em troca de tempos de resposta mais longos e indisponibilidade ocasional de recursos. Ideal para tarefas fora de produção ou de menor prioridade, como avaliações de modelos, enriquecimento de dados ou cargas de trabalho assíncronas.