We bieden de Fast-modus aan API-klanten die bij bepaalde modellen snellere, consistentere prestaties willen. Hieronder vindt u antwoorden op veelgestelde vragen over de werking, prijzen, beschikbaarheid van modellen, volumelimieten, betrouwbaarheid, beleid en deelnamecriteria.
Opmerking: Priority processing is op 30 juli 2026 omgedoopt tot Fast-modus. U kunt zowel service_tier: priority als service_tier: fast gebruiken in uw API-aanvragen.
Lees hier meer.
Is de Fast-modus in alle regio's beschikbaar?
De beschikbaarheid van de Fast-modus hangt af van de toepasselijke wet- en regelgeving in elk rechtsgebied. Neem bij vragen over de beschikbaarheid in uw regio contact op met uw accountdirecteur.
Hoe het werkt
Klanten kunnen verkeer per verzoek naar de Fast-modus sturen met de bestaande parameter service_tier en de optie service_tier = "fast".
Tokens die door de Fast-modus worden verwerkt, worden per token gefactureerd tegen een hoger tarief dan bij standaardverwerking.
Naast de instelling per verzoek kun je de Fast-modus ook als standaard voor een project instellen via Projectinstellingen > Standaardserviceniveau: Fast. Je kunt hier nog steeds per verzoek van afwijken. Fast selecteren in je projectinstellingen heeft hetzelfde effect als Priority selecteren.
Hoe verhoudt dit zich tot het schaalniveau?
Het schaalniveau blijft losstaan van de Fast-modus. Verzoeken die naar de Fast-modus worden gestuurd, worden apart gefactureerd en tellen niet mee voor je aangeschafte TPM-bundels voor het schaalniveau.
Kan ik verkeer dat mijn capaciteit op het schaalniveau overschrijdt automatisch naar de Fast-modus sturen?
Nee. Verkeer dat naar het schaalniveau wordt gestuurd, wordt bij overschrijding van de capaciteit niet automatisch naar de Fast-modus doorgestuurd.
Hoe wordt de Fast-modus gefactureerd?
Tokens die door de Fast-modus worden verwerkt, worden per token gefactureerd tegen een hoger tarief dan bij standaardverwerking.
Is mijn jaarlijkse bestedingsverplichting gekoppeld aan een specifieke verwerkingsmodus?
Nee. Alle verwerkingsmodi tellen mee voor je jaarlijkse Enterprise-bestedingsverplichting.
Krijg ik nog steeds korting op invoertokens in de cache?
Ja! Voor invoer in de cache geldt dezelfde korting van 50–75% als bij standaardverwerking.
Hoe bekijk ik mijn gebruik en kosten van de Fast-modus?
Om te zien welke tokens door de Fast-modus (voorheen Priority-verwerking) zijn verwerkt, ga je naar het gebruiksdashboard, selecteer je Chat Completions of Responses en kies je Groeperen op serviceniveau.
Om de kosten van de Fast-modus te bekijken, ga je naar het gebruiksdashboard en selecteer je Groeperen op factuurregel.
Op het gebruiksdashboard blijven verzoeken met priority of fast als service_tier weergegeven als priority. Dit wordt voor toekomstige modellen bijgewerkt.
Modellen
Is de Fast-modus beschikbaar voor lange contexten, gefinetunede modellen, embeddings enzovoort?
Op dit moment niet. We zullen in de toekomst bekijken of we de Fast-modus naast onze nieuwste modellen ook voor andere producten aanbieden.
Hoe werken andere modaliteiten met de Fast-modus?
De Fast-modus ondersteunt dezelfde multimodale mogelijkheden als standaardverwerking. Zo kunnen afbeeldingen als invoer voor Priority-verwerking worden gebruikt en worden ze met dezelfde lage latentie verwerkt.
Worden toekomstige modellen ondersteund?
We zijn van plan de Fast-modus voor nieuwe GPT-modellen aan te bieden, maar garanderen niet dat elk model wordt ondersteund.
Volumelimieten
Wat zijn de volumelimieten?
Voor de volumelimieten telt het gebruik van Priority-verwerking op dezelfde manier mee als standaard API-verkeer.
Wat zijn de limieten voor de opschalingssnelheid?
De Fast-modus heeft limieten voor de opschalingssnelheid om alle klanten consistent hoge prestaties te bieden, met behoud van flexibele tarieven op basis van gebruik. Als (a) de prestaties van de Fast-modus afnemen EN (b) het verkeer van een klant te snel toeneemt, kunnen sommige verzoeken in zeldzame gevallen worden teruggezet naar standaardverwerking.
De huidige limiet voor de opschalingssnelheid van de Fast-modus staat hier in onze hoofddocumentatie.
Aanbevelingen om binnen je limiet voor de opschalingssnelheid te blijven
Verhoog het verkeer geleidelijk wanneer je van model wisselt. Als je applicatie bijvoorbeeld van een eerdere snapshot naar een nieuwe overstapt, gebruik dan een featureflag om het verkeer in de loop van een paar uur over te zetten in plaats van in één keer.
Voer geen grote gegevensverwerkingstaken of asynchrone taken uit in de Fast-modus. Deze taken kunnen het verkeer zeer snel laten toenemen en hebben de betere prestaties van de Fast-modus vaak niet nodig.
Als je regelmatig tegen de limieten voor de opschalingssnelheid aanloopt, overweeg dan om in plaats daarvan een quotum voor het schaalniveau aan te schaffen.
Gelden de limieten voor de opschalingssnelheid voor al mijn projecten of organisaties samen?
Ja, al je verkeer telt mee voor dezelfde limiet voor de opschalingssnelheid.
Beleid
Wat gebeurt er als de Fast-modus de beoogde latentie niet haalt?
Neem bij vragen of zorgen contact op met je AD. SLA's voor de Fast-modus worden op dezelfde manier behandeld als SLA's voor het schaalniveau. Als we binnen een bepaalde periode niet aan deze SLA's voldoen, bieden we klanten met een Enterprise-overeenkomst servicecredits aan.
Is de Fast-modus compatibel met gegevensresidentie?
Ja.
Is de Fast-modus compatibel met ZDR en de BAA?
Ja.
Ultrafast voor GPT-6 Astra
Ultrafast is een apart serviceniveau voor workloads die antwoorden van GPT-6 Astra met een lagere latentie nodig hebben, zoals interactieve applicaties en programmeerworkflows.
De tarieven, volumelimieten en beleidsrichtlijnen voor de Fast-modus gelden voor verzoeken met service_tier="fast". Ultrafast-verzoeken gebruiken het aparte serviceniveau service_tier="ultrafast".
Hoe verstuur ik een Ultrafast-verzoek?
Gebruik voor een organisatie met toegang tot Ultrafast de Responses API met:
Model:
gpt-6-astraServiceniveau:
ultrafastVerzoekheader:
OpenAI-Service-Tier: ultrafast
De verzoekheader is vereist naast de instelling voor het serviceniveau.
Voor applicaties die toolaanroepen uitvoeren, kun je met de WebSocket-modus een verbinding over meerdere beurten hergebruiken en zo de verbindingsoverhead verminderen.
Kan ik dezelfde verzoekheader voor andere serviceniveaus gebruiken?
Tijdens de alfafase van Ultrafast accepteert de header OpenAI-Service-Tier alleen ultrafast. Als je een andere waarde verstuurt, waaronder default, fast of flex, krijg je een HTTP 400-fout. Laat deze header weg als je een ander serviceniveau gebruikt.
Kan ik Ultrafast in Work of Codex gebruiken?
Ultrafast is ook beschikbaar in Work en Codex voor abonnementen en werkruimten die hiervoor in aanmerking komen. Voor toegang en gebruik via ChatGPT-abonnementen gelden andere voorwaarden dan voor API-toegang.
Zie ChatGPT Work en Codex voor meer informatie over beschikbaarheid en gebruik.
