Nous offrons le Mode rapide aux clients de l’API qui souhaitent bénéficier de performances plus rapides et plus constantes avec certains modèles. Vous trouverez ci-dessous des réponses aux questions courantes sur son fonctionnement, la tarification, la disponibilité des modèles, les limites de débit, la fiabilité, les politiques et l’admissibilité.
Remarque : le traitement prioritaire a été renommé Mode rapide le 30 juillet 2026. Vous pouvez utiliser service_tier: priority ou service_tier: fast dans vos requêtes d’API.
Pour en savoir plus, cliquez ici.
Le Mode rapide est-il offert dans toutes les régions?
La disponibilité du Mode rapide dépend des lois et règlements applicables dans chaque territoire. Veuillez communiquer avec votre directeur de compte si vous avez des questions sur la disponibilité dans votre région.
Fonctionnement
Les clients peuvent diriger le trafic vers le Mode rapide pour chaque requête à l’aide du paramètre existant service_tier, avec l’option service_tier = "fast".
Les tokens traités par le Mode rapide seront facturés à l’unité, à un tarif supérieur à celui du traitement standard.
En plus de le configurer pour chaque requête, vous pouvez définir le Mode rapide comme mode par défaut d’un projet dans Paramètres du projet > Offre par défaut : Rapide. Vous pouvez toujours modifier ce choix pour chaque requête. Sélectionner Rapide dans les paramètres de votre projet équivaut à sélectionner Prioritaire.
Comment cela fonctionne-t-il avec l’offre Scale?
L’offre Scale restera distincte du Mode rapide. Les requêtes envoyées au Mode rapide seront facturées séparément et ne seront pas déduites des forfaits TPM que vous avez achetés dans le cadre de l’offre Scale.
Puis-je envoyer automatiquement le trafic excédentaire de mon offre Scale vers le Mode rapide?
Non. Le trafic envoyé à l’offre Scale ne sera pas automatiquement redirigé vers le Mode rapide en cas de dépassement.
Comment le Mode rapide est-il facturé?
Les tokens traités par le Mode rapide seront facturés à l’unité, à un tarif supérieur à celui du traitement standard.
Mon engagement annuel est-il lié à un mode de traitement précis?
Non. Tous les modes de traitement sont pris en compte dans votre engagement de dépenses annuel Enterprise.
Est-ce que je bénéficie toujours d’un rabais sur les tokens d’entrée mis en cache?
Oui! Les entrées mises en cache bénéficient du même rabais de 50 à 75 % que pour le traitement standard.
Comment consulter mon utilisation et mes dépenses pour le Mode rapide?
Pour consulter les tokens traités par le Mode rapide (anciennement le traitement prioritaire), accédez au tableau de bord d’utilisation, sélectionnez Chat Completions ou Responses, puis regroupez par offre.
Pour consulter le coût du Mode rapide, accédez au tableau de bord d’utilisation et sélectionnez Regrouper par poste de facturation.
Dans le tableau de bord d’utilisation, les requêtes utilisant priority ou fast comme valeur de service_tier continueront de s’afficher sous priority. Cet affichage sera mis à jour pour les futurs modèles.
Modèles
Le Mode rapide est-il offert pour les contextes longs, les modèles affinés, les plongements vectoriels, etc.?
Pas pour le moment. Nous évaluerons à l’avenir la possibilité d’offrir le Mode rapide pour d’autres produits que nos modèles les plus récents.
Comment les autres modalités fonctionnent-elles avec le Mode rapide?
Le Mode rapide prend en charge les mêmes capacités multimodales que le traitement standard. Les images, notamment, peuvent servir d’entrées au traitement prioritaire et sont traitées avec la même faible latence.
Les futurs modèles seront-ils pris en charge?
Nous prévoyons offrir le Mode rapide pour les nouveaux modèles GPT, mais nous ne garantissons pas que chaque modèle sera pris en charge.
Limites de débit
Quelles sont les limites de débit?
L’utilisation du traitement prioritaire est prise en compte de la même façon que le trafic API standard pour les limites de débit.
Quelles sont les limites de vitesse de montée en charge?
Le Mode rapide impose des limites de vitesse de montée en charge pour assurer des performances élevées et constantes à tous les clients, tout en offrant une tarification flexible à la demande. Si (a) les performances du Mode rapide sont dégradées ET (b) le trafic d’un client augmente trop rapidement, certaines requêtes peuvent, dans de rares cas, être redirigées vers le traitement standard.
La limite actuelle de vitesse de montée en charge du Mode rapide est définie dans notre documentation principale, ici.
Pratiques exemplaires pour respecter votre limite de vitesse de montée en charge
Augmentez progressivement le trafic lorsque vous changez de modèle. Par exemple, si votre application passe d’un ancien instantané à un nouveau, utilisez un indicateur de fonctionnalité pour transférer le trafic sur quelques heures plutôt que d’un seul coup.
Évitez d’exécuter des tâches volumineuses de traitement de données ou des tâches asynchrones en Mode rapide. Ces tâches peuvent faire augmenter le trafic très rapidement et n’ont souvent pas besoin des performances améliorées du Mode rapide.
Si vous atteignez régulièrement les limites de vitesse de montée en charge, envisagez plutôt d’acheter un quota de l’offre Scale.
Les limites de vitesse de montée en charge sont-elles partagées entre mes projets ou mes organisations?
Oui, tout votre trafic est pris en compte dans la même limite de vitesse de montée en charge.
Politiques
Que se passe-t-il si le Mode rapide n’atteint pas la latence cible?
Veuillez communiquer avec votre directeur de compte pour toute question ou préoccupation. Les accords de niveau de service du Mode rapide seront traités de la même façon que ceux de l’offre Scale; des crédits de service seront offerts aux clients ayant un contrat Enterprise si nous ne respectons pas ces accords pendant une période donnée.
Le Mode rapide est-il compatible avec la résidence des données?
Oui.
Le Mode rapide est-il compatible avec ZDR et le BAA?
Oui.
Ultrafast pour GPT-6 Astra
Ultrafast est une offre distincte pour les charges de travail qui nécessitent des réponses de GPT-6 Astra à plus faible latence, comme les applications interactives et les flux de travail de programmation.
Les directives sur la tarification, les limites de débit et les politiques du Mode rapide s’appliquent aux requêtes utilisant service_tier="fast". Les requêtes Ultrafast utilisent l’offre distincte service_tier="ultrafast".
Comment envoyer une requête Ultrafast?
Pour une organisation ayant accès à Ultrafast, utilisez l’API Responses avec les paramètres suivants :
Modèle :
gpt-6-astraOffre :
ultrafastEn-tête de requête :
OpenAI-Service-Tier: ultrafast
L’en-tête de requête est requis en plus du paramètre de l’offre.
Pour les applications qui exécutent des appels d’outils, le mode WebSocket permet de réutiliser une connexion d’un tour à l’autre et de réduire la surcharge liée aux connexions.
Puis-je utiliser le même en-tête de requête pour d’autres offres?
Pendant la phase alpha d’Ultrafast, l’en-tête OpenAI-Service-Tier accepte uniquement ultrafast. L’envoi d’une autre valeur, y compris default, fast ou flex, renvoie une erreur HTTP 400. Omettez cet en-tête lorsque vous utilisez une autre offre.
Puis-je utiliser Ultrafast dans Work ou Codex?
Ultrafast est aussi offert dans Work et Codex pour les forfaits et les espaces de travail admissibles. L’admissibilité et l’utilisation des forfaits ChatGPT diffèrent de celles de l’accès à l’API.
Consultez ChatGPT Work et Codex pour en savoir plus sur la disponibilité et l’utilisation.
