We bieden de Fast-modus aan API-klanten die voor bepaalde modellen snellere, consistentere prestaties willen. Hieronder vind je antwoorden op veelgestelde vragen over de werking, prijzen, beschikbaarheid van modellen, volumelimieten, betrouwbaarheid, beleid en deelnamevoorwaarden.
Opmerking: Priority processing is op 30 juli 2026 hernoemd naar Fast-modus. Je kunt in je API-aanvragen zowel service_tier: priority als service_tier: fast gebruiken.
Lees hier meer.
Is de Fast-modus in alle regio's beschikbaar?
De beschikbaarheid van de Fast-modus is afhankelijk van de toepasselijke wet- en regelgeving in elk rechtsgebied. Neem bij vragen over de beschikbaarheid in jouw regio contact op met je accountdirecteur.
Hoe het werkt
Klanten kunnen verkeer per aanvraag naar de Fast-modus sturen via de bestaande parameter service_tier met de optie service_tier = "fast".
Tokens die via de Fast-modus worden verwerkt, worden per token gefactureerd tegen een hoger tarief dan voor standaardverwerking.
Naast configuratie op aanvraagniveau kun je in Projectinstellingen > Standaardserviceniveau: Fast ook de Fast-modus instellen als standaard voor een project. Je kunt dit nog steeds per aanvraag overschrijven. Fast selecteren in je projectinstellingen is hetzelfde als Priority selecteren.
Hoe werkt dit in combinatie met het schaalniveau?
Het schaalniveau blijft gescheiden van de Fast-modus. Aanvragen die naar de Fast-modus worden gestuurd, worden afzonderlijk gefactureerd en tellen niet mee voor de aangeschafte TPM-bundels van je schaalniveau.
Kan ik overtollig verkeer van mijn schaalniveau automatisch naar de Fast-modus sturen?
Nee. Verkeer dat naar het schaalniveau wordt gestuurd, loopt niet automatisch over naar de Fast-modus.
Hoe wordt de Fast-modus gefactureerd?
Tokens die via de Fast-modus worden verwerkt, worden per token gefactureerd tegen een hoger tarief dan voor standaardverwerking.
Is mijn jaarlijkse toezegging gekoppeld aan een specifieke verwerkingsmodus?
Nee. Alle verwerkingsmodi tellen mee voor je jaarlijkse Enterprise-bestedingstoezegging.
Krijg ik nog steeds korting op gecachte invoertokens?
Ja! Voor gecachte invoer geldt dezelfde korting van 50-75% als bij standaardverwerking.
Hoe bekijk ik mijn gebruik en uitgaven voor de Fast-modus?
Ga naar het gebruiksdashboard, selecteer Chat Completions of Responses en kies Groeperen op serviceniveau om tokens te bekijken die zijn verwerkt door de Fast-modus (voorheen Priority processing).
Ga naar het gebruiksdashboard en selecteer Groeperen op regelitem om de kosten van de Fast-modus te bekijken.
Op het gebruiksdashboard blijven aanvragen met priority of fast als service_tier weergegeven als priority. Dit wordt bijgewerkt voor toekomstige modellen.
Modellen
Is de Fast-modus beschikbaar voor lange contextvensters, verfijnde modellen, embeddings enzovoort?
Op dit moment niet. We beoordelen in de toekomst of we de Fast-modus naast onze nieuwste modellen ook voor andere producten gaan aanbieden.
Hoe werken andere modaliteiten met de Fast-modus?
De Fast-modus ondersteunt dezelfde multimodale mogelijkheden als Standard. Afbeeldingen kunnen met name als invoer voor Priority processing worden gebruikt en worden met dezelfde lage latentie verwerkt.
Worden toekomstige modellen ondersteund?
We zijn van plan de Fast-modus voor nieuwe GPT-modellen aan te bieden, maar garanderen niet dat elk model wordt ondersteund.
Volumelimieten
Wat zijn de volumelimieten?
Voor volumelimieten wordt het gebruik van Priority processing hetzelfde behandeld als standaard API-verkeer.
Wat zijn de limieten voor verkeerstoename?
De Fast-modus hanteert limieten voor verkeerstoename om alle klanten consistent hoge prestaties te bieden, met behoud van flexibele prijzen op aanvraag. Als (a) de prestaties van de Fast-modus verminderd zijn EN (b) het verkeer van een klant te snel toeneemt, kunnen sommige aanvragen in zeldzame gevallen worden teruggezet naar standaardverwerking.
De huidige limiet voor verkeerstoename in de Fast-modus staat hier in onze hoofddocumentatie.
Aanbevolen werkwijzen om binnen je limiet voor verkeerstoename te blijven
Verhoog het verkeer geleidelijk wanneer je van model wisselt. Als je applicatie bijvoorbeeld overstapt van een eerdere snapshot naar een nieuwe, gebruik dan een functievlag om het verkeer gedurende enkele uren over te zetten in plaats van alles tegelijk.
Voer geen grote gegevensverwerkings- of asynchrone taken uit in de Fast-modus. Bij deze taken kan het verkeer zeer snel toenemen, terwijl de betere prestaties van de Fast-modus vaak niet nodig zijn.
Als je regelmatig de limieten voor verkeerstoename bereikt, kun je beter quotum voor het schaalniveau aanschaffen.
Worden de limieten voor verkeerstoename gedeeld tussen mijn projecten of organisaties?
Ja, al je verkeer telt mee voor dezelfde limiet voor verkeerstoename.
Beleid
Wat gebeurt er als de Fast-modus de latentiedoelstelling niet haalt?
Neem bij vragen of zorgen contact op met je AD. Voor SLA's van de Fast-modus gelden dezelfde voorwaarden als voor SLA's van het schaalniveau. Als we die SLA's binnen een bepaald tijdvenster niet halen voor klanten met een Enterprise-overeenkomst, bieden we servicecredits aan.
Is de Fast-modus compatibel met gegevensresidentie?
Ja.
Is de Fast-modus compatibel met ZDR en de BAA?
Ja.
