Vi erbjuder Snabbläge för API-kunder som vill ha snabbare och jämnare prestanda för vissa modeller. Nedan finns svar på vanliga frågor om hur det fungerar, prissättning, tillgängliga modeller, frekvensgränser, tillförlitlighet, policyer och behörighet.
Obs! Prioriterad bearbetning bytte namn till Snabbläge den 30 juli 2026. Du kan använda antingen service_tier: priority eller service_tier: fast i dina API-anrop.
Läs mer här.
Är Snabbläge tillgängligt i alla regioner?
Tillgängligheten för Snabbläge beror på tillämpliga lagar och regler i varje jurisdiktion. Kontakta din kundansvariga om du har frågor om tillgängligheten i din region.
Så fungerar det
Kunder kan styra enskilda begäranden till Snabbläge med den befintliga parametern service_tier och alternativet service_tier = "fast".
Token som bearbetas i Snabbläge debiteras per token, till ett högre pris än vid standardbearbetning.
Utöver att ange Snabbläge för enskilda begäranden kan du välja det som standard för ett projekt under Projektinställningar > Standardservicenivå: Snabb. Du kan fortfarande åsidosätta inställningen för enskilda begäranden. Att välja Snabb i projektinställningarna motsvarar att välja Prioriterad.
Hur fungerar detta tillsammans med Skalningsnivå?
Skalningsnivå förblir separat från Snabbläge. Begäranden som skickas till Snabbläge debiteras separat och räknas inte av från dina köpta TPM-paket på Skalningsnivå.
Kan jag automatiskt skicka trafik som överskrider min kvot på Skalningsnivå till Snabbläge?
Nej. Överskjutande trafik som skickas till Skalningsnivå förs inte automatiskt över till Snabbläge.
Hur debiteras Snabbläge?
Token som bearbetas i Snabbläge debiteras per token, till ett högre pris än vid standardbearbetning.
Är mitt årliga köpåtagande knutet till ett visst bearbetningsläge?
Nej. Användning av alla bearbetningslägen räknas in i ditt årliga köpåtagande för Enterprise.
Får jag fortfarande rabatt på cachelagrade indatatoken?
Ja! Cachelagrade indata får samma rabatt på 50–75 % som vid standardbearbetning.
Hur ser jag min användning och mina kostnader för Snabbläge?
För att se token som bearbetats i Snabbläge (tidigare prioriterad bearbetning) går du till användningspanelen, väljer Chat Completions eller Responses och sedan Gruppera efter servicenivå.
För att se kostnaden för Snabbläge går du till användningspanelen och väljer Gruppera efter fakturarad.
I användningspanelen visas begäranden som använder antingen priority eller fast som service_tier även fortsättningsvis som priority. Detta kommer att uppdateras för framtida modeller.
Modeller
Är Snabbläge tillgängligt för lång kontext, finjusterade modeller, inbäddningar osv.?
Inte för närvarande. Framöver kommer vi att utvärdera om Snabbläge ska erbjudas för fler produkter än våra senaste modeller.
Hur fungerar andra modaliteter med Snabbläge?
Snabbläge stöder samma multimodala funktioner som Standard. Bilder kan användas som indata vid prioriterad bearbetning och bearbetas med samma låga latens.
Kommer framtida modeller att stödjas?
Vi planerar att erbjuda Snabbläge för nya GPT-modeller, men vi garanterar inte stöd för varje modell.
Frekvensgränser
Vilka frekvensgränser gäller?
Användning av prioriterad bearbetning räknas på samma sätt som vanlig API-trafik när det gäller frekvensgränser.
Vilka gränser gäller för upptrappningstakten?
Snabbläge har gränser för upptrappningstakten för att säkerställa jämn och hög prestanda för alla kunder, samtidigt som prissättningen är flexibel och användningsbaserad. Om (a) prestandan i Snabbläge försämras OCH (b) en kunds trafik ökar för snabbt, kan vissa begäranden i sällsynta fall nedgraderas till standardbearbetning.
Den aktuella gränsen för upptrappningstakt i Snabbläge anges i vår huvuddokumentation här.
Rekommendationer för att hålla dig inom gränsen för upptrappningstakt
Öka trafiken gradvis när du byter modell. Om din applikation till exempel går från en tidigare ögonblicksversion till en ny, använd en funktionsflagga för att flytta över trafiken under några timmar i stället för allt på en gång.
Undvik att köra stora databearbetningsjobb eller asynkrona jobb i Snabbläge. Dessa jobb kan öka trafiken mycket snabbt och behöver ofta inte den förbättrade prestandan i Snabbläge.
Om du ofta når gränserna för upptrappningstakt kan du överväga att köpa en kvot på Skalningsnivå i stället.
Är gränserna för upptrappningstakt gemensamma för mina projekt eller organisationer?
Ja, all din trafik räknas mot samma gräns för upptrappningstakt.
Policyer
Vad händer om Snabbläge inte uppfyller latensmålet?
Kontakta din AD om du har frågor eller funderingar. SLA:er för Snabbläge hanteras på samma sätt som SLA:er för Skalningsnivå. Tjänstekrediter erbjuds om vi inte uppfyller dessa SLA:er för kunder med Enterprise-avtal under en viss tidsperiod.
Är Snabbläge kompatibelt med datahemvist?
Ja.
Är Snabbläge kompatibelt med ZDR och BAA-avtalet?
Ja.
Ultrafast för GPT-6 Astra
Ultrafast är en separat servicenivå för arbetsbelastningar som behöver svar från GPT-6 Astra med lägre latens, till exempel interaktiva applikationer och arbetsflöden för kodning.
Priser, frekvensgränser och policyriktlinjer för Snabbläge gäller för begäranden som använder service_tier="fast". Ultrafast-begäranden använder den separata nivån service_tier="ultrafast".
Hur skickar jag en Ultrafast-begäran?
För en organisation med åtkomst till Ultrafast använder du Responses API med:
Modell:
gpt-6-astraServicenivå:
ultrafastHuvudfält för begäran:
OpenAI-Service-Tier: ultrafast
Huvudfältet i begäran krävs utöver inställningen för servicenivå.
För applikationer som utför verktygsanrop gör WebSocket-läge det möjligt att återanvända en anslutning mellan samtalsturer och minska anslutningskostnaden.
Kan jag använda samma huvudfält i begäran för andra servicenivåer?
Under alfafasen för Ultrafast accepterar huvudfältet OpenAI-Service-Tier endast ultrafast. Om du skickar ett annat värde, inklusive default, fast eller flex, returneras ett HTTP 400-fel. Utelämna det här huvudfältet när du använder en annan nivå.
Kan jag använda Ultrafast i Work eller Codex?
Ultrafast är också tillgängligt i Work och Codex för berättigade abonnemang och arbetsytor. Villkoren för åtkomst och användning via ChatGPT-abonnemang skiljer sig från dem för API-åtkomst.
Se ChatGPT Work och Codex för information om tillgänglighet och användning.
