OpenAI
Cette page a été traduite automatiquement. Afficher l’article original en anglais.

FAQ sur le mode Rapide

Questions fréquentes sur le mode Rapide et l’offre Ultrafast.

Dernière mise à jour : 7 hours ago

Nous proposons le mode Rapide aux clients de l’API qui souhaitent bénéficier de performances plus rapides et plus constantes sur certains modèles. Vous trouverez ci-dessous les réponses aux questions fréquentes sur son fonctionnement, la tarification, la disponibilité des modèles, les limites de débit, la fiabilité, les politiques et les critères d’éligibilité.

Remarque : le traitement prioritaire a été renommé mode Rapide le 30 juillet 2026. Vous pouvez utiliser service_tier: priority ou service_tier: fast dans vos requêtes API. 

En savoir plus ici.

Le mode Rapide est-il disponible dans toutes les régions ?

La disponibilité du mode Rapide dépend des lois et réglementations applicables dans chaque juridiction. Pour toute question concernant la disponibilité dans votre région, veuillez contacter votre directeur de compte.

Fonctionnement

Les clients peuvent diriger le trafic vers le mode Rapide pour chaque requête à l’aide du paramètre existant service_tier, avec l’option service_tier = "fast".

Les tokens traités en mode Rapide seront facturés au token, à un tarif supérieur à celui du traitement standard.

Outre la configuration par requête, vous pouvez aussi définir le mode Rapide par défaut pour un projet dans Paramètres du projet > Offre par défaut : Rapide. Vous pouvez toujours remplacer ce réglage pour chaque requête. Sélectionner Rapide dans les paramètres de votre projet équivaut à sélectionner Prioritaire.

Comment cela s’articule-t-il avec l’offre Scale ?

L’offre Scale restera distincte du mode Rapide. Les requêtes envoyées au mode Rapide seront facturées séparément et ne seront pas décomptées des lots de TPM que vous avez achetés dans le cadre de l’offre Scale.

Puis-je envoyer automatiquement vers le mode Rapide le trafic qui dépasse mon quota de l’offre Scale ?

Non. Le trafic envoyé à l’offre Scale ne basculera pas automatiquement vers le mode Rapide en cas de dépassement.

Comment le mode Rapide est-il facturé ?

Les tokens traités en mode Rapide seront facturés au token, à un tarif supérieur à celui du traitement standard.

Mon engagement annuel est-il lié à un mode de traitement spécifique ?

Non. Tous les modes de traitement sont pris en compte dans votre engagement de dépenses annuel Enterprise.

Est-ce que je bénéficie toujours d’une réduction sur les tokens d’entrée mis en cache ?

Oui ! Les entrées mises en cache bénéficient de la même réduction de 50 à 75 % qu’avec le traitement standard.

Comment consulter mon utilisation et mes dépenses en mode Rapide ?

Pour consulter les tokens traités en mode Rapide (anciennement traitement prioritaire), accédez au tableau de bord Utilisation, sélectionnez Chat Completions ou Responses, puis Regrouper par offre.

Pour consulter le coût du mode Rapide, accédez au tableau de bord Utilisation, puis sélectionnez Regrouper par poste de facturation.

Dans le tableau de bord Utilisation, les requêtes utilisant priority ou fast comme valeur de service_tier continueront d’apparaître sous priority. Cela sera mis à jour pour les futurs modèles.

Modèles

Le mode Rapide est-il disponible pour les contextes longs, les modèles affinés, les embeddings, etc. ?

Pas pour le moment. Nous étudierons à l’avenir la possibilité de proposer le mode Rapide sur d’autres produits, au-delà de nos modèles les plus récents.

Comment les autres modalités fonctionnent-elles avec le mode Rapide ?

Le mode Rapide prend en charge les mêmes capacités multimodales que le traitement standard. Les images, en particulier, peuvent être utilisées en entrée du traitement prioritaire et bénéficient de la même faible latence.

Les futurs modèles seront-ils pris en charge ?

Nous prévoyons de proposer le mode Rapide sur les nouveaux modèles GPT, mais nous ne garantissons pas la prise en charge de tous les modèles.

Limites de débit

Quelles sont les limites de débit ?

Pour les limites de débit, la consommation liée au traitement prioritaire est comptabilisée comme le trafic API standard.

Quelles sont les limites de vitesse de montée en charge ?

Le mode Rapide impose des limites de vitesse de montée en charge pour garantir des performances élevées et constantes à tous les clients, tout en proposant une tarification flexible à la demande. Si (a) les performances du mode Rapide sont dégradées ET (b) le trafic d’un client augmente trop vite, certaines requêtes peuvent, dans de rares cas, être basculées vers le traitement standard.

La limite actuelle de vitesse de montée en charge du mode Rapide est définie dans notre documentation principale, ici.

Bonnes pratiques pour respecter votre limite de vitesse de montée en charge

Augmentez progressivement le trafic lorsque vous changez de modèle. Par exemple, si votre application passe d’un ancien instantané à un nouveau, utilisez un indicateur de fonctionnalité pour transférer le trafic sur quelques heures plutôt qu’en une seule fois.

Évitez d’exécuter des tâches de traitement de données volumineuses ou des tâches asynchrones en mode Rapide. Ces tâches peuvent faire augmenter le trafic très rapidement et n’ont souvent pas besoin des performances accrues du mode Rapide.

Si vous atteignez régulièrement les limites de vitesse de montée en charge, envisagez plutôt d’acheter un quota de l’offre Scale.

Les limites de vitesse de montée en charge sont-elles partagées entre mes projets ou organisations ?

Oui, l’ensemble de votre trafic est soumis à la même limite de vitesse de montée en charge.

Politiques

Que se passe-t-il si le mode Rapide n’atteint pas l’objectif de latence ?

Pour toute question ou préoccupation, veuillez contacter votre responsable de compte. Les SLA du mode Rapide seront traités comme ceux de l’offre Scale ; des crédits de service seront proposés si nous ne respectons pas ces SLA pour les clients sous contrat Enterprise pendant une période donnée.

Le mode Rapide est-il compatible avec la résidence des données ?

Oui.

Le mode Rapide est-il compatible avec ZDR et le BAA ?

Oui.

Ultrafast pour GPT-6 Astra

Ultrafast est une offre distincte destinée aux charges de travail nécessitant des réponses de GPT-6 Astra à plus faible latence, comme les applications interactives et les workflows de programmation.

Les consignes du mode Rapide concernant la tarification, les limites de débit et les politiques s’appliquent aux requêtes utilisant service_tier="fast". Les requêtes Ultrafast utilisent l’offre distincte service_tier="ultrafast".

Comment envoyer une requête Ultrafast ?

Pour une organisation disposant d’un accès à Ultrafast, utilisez l’API Responses avec :

  • Modèle : gpt-6-astra

  • Offre : ultrafast

  • En-tête de requête : OpenAI-Service-Tier: ultrafast

L’en-tête de requête est obligatoire en plus du paramètre de l’offre.

Pour les applications qui exécutent des appels d’outils, le mode WebSocket permet de réutiliser une connexion au fil des échanges et de réduire le surcoût lié aux connexions.

Puis-je utiliser le même en-tête de requête pour d’autres offres ?

Pendant la phase alpha d’Ultrafast, l’en-tête OpenAI-Service-Tier accepte uniquement ultrafast. L’envoi d’une autre valeur, y compris default, fast ou flex, renvoie une erreur HTTP 400. Omettez cet en-tête lorsque vous utilisez une autre offre.

Puis-je utiliser Ultrafast dans Work ou Codex ?

Ultrafast est également disponible dans Work et Codex pour les forfaits et espaces de travail éligibles. L’éligibilité et l’utilisation liées aux forfaits ChatGPT diffèrent de celles de l’accès à l’API.

Consultez ChatGPT Work et Codex pour en savoir plus sur la disponibilité et l’utilisation.

Cet article vous a-t-il été utile ?