For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navigation principale

Mode Rapide

Bénéficiez d’une vitesse jusqu’à 2,5× supérieure dans l’API.

Le mode Rapide offre une vitesse jusqu’à 2,5× supérieure et une latence plus stable, tout en conservant la souplesse de la tarification à l’usage. Il est idéal pour les applications à forte valeur ajoutée destinées aux utilisateurs, dont le trafic est régulier et pour lesquelles la latence est primordiale.

Le traitement prioritaire a été renommé mode Rapide le 30 juillet 2026. Nous avons également augmenté la vitesse du mode Rapide pour gpt-5.6-sol, afin de le rendre jusqu’à 2,5× plus rapide que le traitement standard. Vous pouvez utiliser service_tier: "priority" ou service_tier: "fast" dans vos requêtes API pour accéder à cette fonctionnalité.

Configuration du mode Rapide

Vous pouvez configurer les requêtes envoyées à l’API Responses ou à l’API Chat Completions pour qu’elles utilisent le mode Rapide, à l’aide d’un paramètre de requête ou d’un paramètre du projet.

Pour activer le mode Rapide pour une requête individuelle, définissez le paramètre service_tier sur fast. Définir service_tier sur priority produit le même comportement pour les modèles compatibles.

Créer une réponse avec le mode Rapide
from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-5.6-sol",
    input="What does 'fit check for my napalm era' mean?",
    service_tier="fast",
)
print(response)

Pour l’activer au niveau du projet, ouvrez les Paramètres, sélectionnez Général sous Projet, puis définissez Offre du projet sur Rapide. Les requêtes qui ne précisent pas de service_tier utilisent alors le mode Rapide par défaut. Les requêtes du projet passent progressivement au mode Rapide.

Le champ service_tier de l’objet de réponse Responses ou Chat Completions indique l’offre utilisée pour traiter la requête. Pour GPT-5.6 et les modèles antérieurs, la réponse renvoie priority, que la requête indique priority ou fast.

Limites de débit et montée en charge

Limites de base

La consommation en mode Rapide est comptabilisée dans les limites de débit de la même manière que le traitement standard. Utilisez votre logique habituelle de nouvelle tentative et prévoyez un délai entre les tentatives. Pour un modèle donné, le traitement standard et le mode Rapide partagent la même limite de débit.

Limite de montée en charge

Si votre trafic augmente trop rapidement, le système peut traiter certaines requêtes en mode Rapide à la vitesse standard et leur appliquer les tarifs standard. Dans ce cas, la réponse contient service_tier: "default". En règle générale, une fois que votre trafic atteint 1 million de tokens d’entrée par minute (TPM), ne l’augmentez pas de plus de 50 % toutes les 15 minutes. Le seuil exact auquel la limite de montée en charge s’applique peut varier selon le modèle et les conditions de trafic.

Pour éviter de déclencher la limite de montée en charge :

  • Augmentez progressivement le trafic lorsque vous changez de modèle ou de snapshot.
  • Utilisez des indicateurs de fonctionnalité pour basculer le trafic sur plusieurs heures, plutôt qu’instantanément.
  • Évitez d’exécuter des tâches volumineuses d’extraction, de transformation et de chargement (ETL) ou de traitement par lots en mode Rapide.

Points à prendre en compte

  • Le mode Rapide applique un supplément par token par rapport au traitement standard. Consultez la page des tarifs pour connaître les détails et les modèles compatibles.
  • Les remises sur les entrées mises en cache s’appliquent également aux requêtes en mode Rapide.
  • Le mode Rapide prend en charge les requêtes multimodales, y compris les images en entrée.
  • Pour afficher les requêtes en mode Rapide dans le tableau de bord d’utilisation, sélectionnez l’option de regroupement par offre. Pour GPT-5.6 et les modèles antérieurs, ces requêtes apparaissent sous priority, même lorsque vous indiquez fast.
  • Les modèles GPT-5.6 prennent en charge les contextes longs. Le mode Rapide ne prend pas en charge les modèles affinés ni les plongements vectoriels.

Questions fréquentes

Pour obtenir des informations sur les comptes et les politiques applicables, consultez la FAQ du mode Rapide.

Le mode Rapide est-il disponible dans toutes les régions ?

La disponibilité dépend des lois et réglementations de chaque juridiction. Contactez votre responsable de compte si vous avez des questions sur la disponibilité dans votre région.

Comment le mode Rapide s’articule-t-il avec l’offre Scale ?

L’offre Scale et le mode Rapide sont distincts. Les requêtes en mode Rapide sont facturées séparément et ne sont pas décomptées des forfaits TPM achetés dans le cadre de l’offre Scale. Le trafic qui dépasse la capacité de l’offre Scale ne passe pas automatiquement au mode Rapide.

Comment le mode Rapide est-il facturé ?

Le mode Rapide applique un supplément par token par rapport au traitement standard. Tous les modes de traitement sont comptabilisés dans votre engagement de dépenses annuel Entreprise, et les tokens d’entrée mis en cache éligibles bénéficient des mêmes remises que pour le traitement standard.

Pour GPT-5.6 Sol, le mode Rapide coûte deux fois le tarif standard correspondant. Les requêtes à contexte court coûtent 8 $ par million de tokens d’entrée et 40 $ par million de tokens de sortie ; les requêtes à contexte long coûtent 16 $ par million de tokens d’entrée et 60 $ par million de tokens de sortie. Les tarifs promotionnels de GPT-5.6 Sol sont disponibles au moins jusqu’au 21 novembre 2026 inclus. Consultez les détails des tarifs.

Pour consulter votre utilisation, ouvrez le tableau de bord d’utilisation, sélectionnez Responses ou Chat Completions, puis regroupez les données par offre. Pour consulter les coûts, regroupez-les par poste de facturation.

Quels modèles et modalités prennent en charge le mode Rapide ?

Le mode Rapide prend en charge les capacités multimodales disponibles avec le traitement standard, y compris les images en entrée. Les modèles GPT-5.6 prennent en charge les contextes longs. Le mode Rapide ne prend pas en charge les modèles affinés ni les plongements vectoriels. Les futurs modèles GPT pourraient prendre en charge le mode Rapide, mais cette prise en charge n’est pas garantie pour chaque modèle.

Les limites de montée en charge sont-elles partagées entre les projets ou les organisations ?

Oui. L’ensemble de votre trafic est pris en compte dans la même limite de montée en charge. Si vous atteignez régulièrement ces limites, envisagez d’acheter du quota dans le cadre de l’offre Scale.

Que se passe-t-il si le mode Rapide ne respecte pas son objectif de latence ?

Le mode Rapide pour GPT-6 Astra n’inclut pas d’accord de niveau de service (SLA) relatif à la latence. Pour GPT-5.6 et les modèles antérieurs, le mode Rapide et l’offre Scale sont soumis aux mêmes dispositions en matière d’accord de niveau de service, et les contrats Entreprise éligibles peuvent prévoir des crédits de service lorsque les objectifs de latence ne sont pas respectés. Contactez votre responsable de compte si vous avez des questions ou des préoccupations.

Le mode Rapide est-il compatible avec la résidence des données, la politique de non-conservation des données et un BAA ?

Le mode Rapide est compatible avec la résidence des données, la politique de non-conservation des données et un accord de partenariat commercial (BAA), sous réserve de disponibilité pour le modèle concerné. GPT-6 Astra ne prend pas en charge le mode Rapide avec la résidence des données dans l’UE. Les exigences existantes relatives aux points de terminaison, aux outils, à l’éligibilité et aux contrats continuent de s’appliquer. Consultez le guide Vos données pour en savoir plus.