For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegação principal

Processamento Flex

Otimize os custos com o processamento Flex.

O processamento Flex oferece custos menores para requisições às APIs Responses ou Chat Completions em troca de tempos de resposta mais longos e indisponibilidade ocasional de recursos. É ideal para tarefas fora de produção ou de menor prioridade, como avaliações de modelos, enriquecimento de dados e cargas de trabalho assíncronas.

Os tokens são cobrados pelas tarifas da API Batch, com descontos adicionais pelo uso de cache de prompts.

O processamento Flex está em beta e disponível para um conjunto limitado de modelos. Os modelos compatíveis estão listados na página de preços.

Uso da API

Para usar o processamento Flex, defina o parâmetro service_tier como flex na sua requisição à API:

Exemplo de processamento Flex
from openai import OpenAI

client = OpenAI(
    # increase default timeout to 15 minutes (from 10 minutes)
    timeout=900.0
)

# you can override the max timeout per request as well
response = client.with_options(timeout=900.0).responses.create(
    model="gpt-6-astra",
    instructions="List and describe all the metaphors used in this book.",
    input="<very long text of book here>",
    service_tier="flex",
)

print(response.output_text)

Tempos limite das requisições à API

Como o processamento Flex é mais lento, as requisições têm maior probabilidade de exceder o tempo limite. Veja alguns pontos a considerar ao lidar com essas situações:

  • Tempo limite padrão: O tempo limite padrão é de 10 minutos para requisições à API feitas com um SDK oficial da OpenAI. Pode ser necessário aumentar esse tempo limite para prompts longos ou tarefas complexas.
  • Configuração dos tempos limite: Cada SDK oferece um parâmetro para aumentar esse tempo limite. Nos SDKs de Python e JavaScript, esse parâmetro é timeout, como mostrado nos exemplos de código acima.
  • Novas tentativas automáticas: Os SDKs da OpenAI repetem automaticamente duas vezes as requisições que retornam o código de erro 408 Request Timeout antes de lançar uma exceção.

Erros de indisponibilidade de recursos

Às vezes, o processamento Flex pode não ter recursos suficientes para atender às suas requisições, resultando no código de erro 429 Resource Unavailable. Não haverá cobrança quando isso ocorrer.

Considere implementar estas estratégias para lidar com erros de indisponibilidade de recursos:

  • Repita as requisições com espera exponencial: Implementar uma espera exponencial é adequado para cargas de trabalho que toleram atrasos e tem como objetivo minimizar os custos, pois sua requisição poderá ser concluída quando houver mais capacidade disponível. Para detalhes de implementação, consulte este exemplo do Cookbook.

  • Repita as requisições com processamento padrão: Ao receber um erro de indisponibilidade de recursos, implemente uma estratégia de novas tentativas com processamento padrão se, no seu caso de uso, valer a pena aceitar custos ocasionalmente mais altos para garantir a conclusão bem-sucedida. Para isso, defina service_tier como auto na nova tentativa ou remova o parâmetro service_tier para usar o modo padrão do projeto.