For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navigation principale

Traitement Flex

Optimisez les coûts avec le traitement Flex.

Le traitement Flex réduit le coût des requêtes Responses ou Chat Completions en contrepartie de temps de réponse plus longs et d’une indisponibilité occasionnelle des ressources. Il convient parfaitement aux tâches hors production ou moins prioritaires, comme l’évaluation de modèles, l’enrichissement de données et les charges de travail asynchrones.

Les tokens sont facturés aux tarifs de l’API Batch, avec des réductions supplémentaires grâce à la mise en cache des prompts.

Le traitement Flex est en version bêta et n’est disponible que pour un nombre limité de modèles. Les modèles pris en charge sont répertoriés sur la page des tarifs.

Utilisation de l’API

Pour utiliser le traitement Flex, définissez le paramètre service_tier sur flex dans votre requête API :

Exemple de traitement Flex
from openai import OpenAI

client = OpenAI(
    # increase default timeout to 15 minutes (from 10 minutes)
    timeout=900.0
)

# you can override the max timeout per request as well
response = client.with_options(timeout=900.0).responses.create(
    model="gpt-6-astra",
    instructions="List and describe all the metaphors used in this book.",
    input="<very long text of book here>",
    service_tier="flex",
)

print(response.output_text)

Délais d’expiration des requêtes API

Le traitement Flex étant plus lent, les requêtes risquent davantage d’expirer. Voici quelques points à prendre en compte pour gérer ces expirations :

  • Délai d’expiration par défaut : le délai d’expiration par défaut est de 10 minutes pour les requêtes API effectuées avec un SDK OpenAI officiel. Vous devrez peut-être augmenter ce délai pour les prompts longs ou les tâches complexes.
  • Configuration des délais d’expiration : chaque SDK propose un paramètre permettant d’augmenter ce délai. Dans les SDK Python et JavaScript, il s’agit de timeout, comme le montrent les exemples de code ci-dessus.
  • Nouvelles tentatives automatiques : les SDK OpenAI relancent automatiquement deux fois les requêtes qui renvoient le code d’erreur 408 Request Timeout avant de lever une exception.

Erreurs d’indisponibilité des ressources

Le traitement Flex peut parfois manquer de ressources pour traiter vos requêtes, ce qui entraîne un code d’erreur 429 Resource Unavailable. Aucuns frais ne vous sont facturés dans ce cas.

Envisagez les stratégies suivantes pour gérer les erreurs d’indisponibilité des ressources :

  • Relancez les requêtes avec un délai d’attente exponentiel : cette stratégie convient aux charges de travail qui peuvent tolérer des délais et vise à minimiser les coûts, car votre requête peut finir par aboutir lorsque davantage de capacité est disponible. Pour les détails de mise en œuvre, consultez cet exemple du Cookbook.

  • Relancez les requêtes avec le traitement standard : lorsque vous recevez une erreur d’indisponibilité des ressources, adoptez une stratégie de nouvelle tentative avec le traitement standard si, pour votre cas d’usage, assurer l’aboutissement des requêtes justifie des coûts ponctuellement plus élevés. Pour cela, définissez service_tier sur auto dans la requête relancée, ou supprimez le paramètre service_tier pour utiliser le mode par défaut du projet.