For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegação principal

Otimização de custos

Aumente sua eficiência e reduza custos.

Há várias maneiras de reduzir custos ao usar modelos da OpenAI. Custo e latência geralmente estão interligados: reduzir tokens e requisições costuma acelerar o processamento. A API Batch da OpenAI e o processamento Flex são outras formas de reduzir custos.

Custo e latência

Para reduzir a latência e o custo, considere as seguintes estratégias:

  • Reduza as requisições: Limite o número de requisições necessárias para concluir tarefas.
  • Minimize os tokens: Reduza o número de tokens de entrada e otimize as respostas do modelo para que sejam mais curtas.
  • Selecione um modelo menor: Use modelos que equilibrem a redução de custos e latência com a manutenção da precisão.

Para saber mais sobre essas estratégias, consulte nosso guia de otimização de latência.

API Batch

Processe tarefas de forma assíncrona. A API Batch oferece um conjunto simples de endpoints que permitem reunir requisições em um único arquivo, iniciar uma tarefa de processamento em lote para executá-las, consultar o status do lote enquanto as requisições são executadas e recuperar os resultados reunidos quando o lote for concluído.

Primeiros passos com a API Batch →

Processamento Flex

Obtenha custos significativamente menores para requisições de Chat Completions ou Responses em troca de tempos de resposta mais longos e indisponibilidade ocasional de recursos. Ideal para tarefas fora de produção ou de menor prioridade, como avaliações de modelos, enriquecimento de dados ou cargas de trabalho assíncronas.

Primeiros passos com o processamento Flex →