Vi tilbyder Hurtig tilstand til API-kunder, der ønsker hurtigere og mere ensartet ydeevne med bestemte modeller. Nedenfor finder du svar på ofte stillede spørgsmål om, hvordan det fungerer, priser, modeltilgængelighed, brugsgrænser, driftssikkerhed, politikker og adgangskrav.
Bemærk: Prioritetsbehandling skiftede navn til Hurtig tilstand den 30. juli 2026. Du kan bruge enten service_tier: priority eller service_tier: fast i dine API-anmodninger.
Få mere at vide her.
Er Hurtig tilstand tilgængelig i alle regioner?
Tilgængeligheden af Hurtig tilstand afhænger af gældende love og regler i den enkelte jurisdiktion. Kontakt din kundeansvarlige, hvis du har spørgsmål om tilgængeligheden i din region.
Sådan fungerer det
Kunder kan sende trafik til Hurtig tilstand for hver enkelt anmodning ved at bruge den eksisterende service_tier-parameter med indstillingen service_tier = "fast".
Token behandlet i Hurtig tilstand faktureres pr. token til en højere pris end ved standardbehandling.
Ud over at indstille Hurtig tilstand for den enkelte anmodning kan du også vælge den som standard for et projekt under Projektindstillinger > Standardserviceniveau: Hurtig. Du kan stadig tilsidesætte indstillingen for hver enkelt anmodning. At vælge Hurtig i dine projektindstillinger svarer til at vælge Prioritet.
Hvordan fungerer dette sammen med Skaleringsniveau?
Skaleringsniveau forbliver adskilt fra Hurtig tilstand. Anmodninger sendt til Hurtig tilstand faktureres separat og tæller ikke med i dine købte TPM-pakker på Skaleringsniveau.
Kan jeg automatisk sende trafik, der overstiger min kvote på Skaleringsniveau, til Hurtig tilstand?
Nej. Trafik, der sendes til Skaleringsniveau, overføres ikke automatisk til Hurtig tilstand, når kvoten er opbrugt.
Hvordan faktureres Hurtig tilstand?
Token behandlet i Hurtig tilstand faktureres pr. token til en højere pris end ved standardbehandling.
Er min årlige forbrugsforpligtelse knyttet til en bestemt behandlingstilstand?
Nej. Forbrug i alle behandlingstilstande tæller med i din årlige forbrugsforpligtelse under Enterprise-aftalen.
Får jeg stadig rabat på cachelagrede inputtoken?
Ja! Cachelagrede input får samme rabat på 50-75 % som ved standardbehandling.
Hvordan ser jeg mit forbrug og mine udgifter til Hurtig tilstand?
For at se token behandlet i Hurtig tilstand (tidligere kaldet prioriteret behandling) skal du gå til forbrugsoversigten, vælge Chat Completions eller Responses og gruppere efter Serviceniveau.
For at se udgifterne til Hurtig tilstand skal du gå til forbrugsoversigten og vælge Gruppér efter linjepost.
I forbrugsoversigten vil anmodninger, der bruger enten priority eller fast som service_tier, fortsat blive vist som priority. Dette vil blive opdateret for fremtidige modeller.
Modeller
Er Hurtig tilstand tilgængelig til lang kontekst, finjusterede modeller, indlejringer osv.?
Ikke på nuværende tidspunkt. Vi vil fremover vurdere, om vi skal tilbyde Hurtig tilstand til andre produkter end vores nyeste modeller.
Hvordan fungerer andre modaliteter med Hurtig tilstand?
Hurtig tilstand understøtter de samme multimodale funktioner som Standard. Billeder kan for eksempel bruges som input til prioriteret behandling og behandles med samme lave svartid.
Vil fremtidige modeller blive understøttet?
Vi planlægger at tilbyde Hurtig tilstand til nye GPT-modeller, men vi garanterer ikke, at alle modeller vil blive understøttet.
Brugsgrænser
Hvilke brugsgrænser gælder?
Forbrug ved prioriteret behandling tæller på samme måde som almindelig API-trafik i forhold til brugsgrænser.
Hvilke grænser gælder for forøgelseshastighed?
Hurtig tilstand har grænser for forøgelseshastighed for at sikre stabilt høj ydeevne for alle kunder og samtidig tilbyde fleksibel, forbrugsbaseret betaling. Hvis (a) ydeevnen i Hurtig tilstand er forringet, OG (b) en kundes trafik stiger for hurtigt, kan nogle anmodninger i sjældne tilfælde blive nedgraderet til standardbehandling.
Den aktuelle grænse for forøgelseshastighed i Hurtig tilstand er defineret i vores primære dokumentation her.
Gode råd til at holde dig inden for grænsen for forøgelseshastighed
Øg trafikken gradvist, når du skifter model. Hvis din applikation for eksempel skifter fra et tidligere snapshot til et nyt, skal du bruge et funktionsflag til at flytte trafikken over i løbet af et par timer i stedet for på én gang.
Undgå at køre store databehandlingsopgaver eller asynkrone job i Hurtig tilstand. Disse job kan øge trafikken meget hurtigt og har ofte ikke brug for den forbedrede ydeevne i Hurtig tilstand.
Hvis du ofte rammer grænsen for forøgelseshastighed, bør du overveje at købe en kvote på Skaleringsniveau i stedet.
Gælder grænserne for forøgelseshastighed på tværs af mine projekter eller organisationer?
Ja, al din trafik tæller med under den samme grænse for forøgelseshastighed.
Politikker
Hvad sker der, hvis Hurtig tilstand ikke opfylder målet for svartid?
Kontakt din AD, hvis du har spørgsmål eller bekymringer. SLA'er for Hurtig tilstand behandles på samme måde som SLA'er for Skaleringsniveau. Kunder med Enterprise-aftaler vil blive tilbudt servicekreditter, hvis vi ikke opfylder disse SLA'er i et givent tidsrum.
Er Hurtig tilstand kompatibel med dataresidens?
Ja.
Er Hurtig tilstand kompatibel med ZDR og BAA-aftalen?
Ja.
Ultrafast til GPT-6 Astra
Ultrafast er et separat serviceniveau til arbejdsbelastninger, der kræver hurtigere svar fra GPT-6 Astra, såsom interaktive applikationer og arbejdsgange til kodning.
Priser, brugsgrænser og retningslinjer for Hurtig tilstand gælder for anmodninger, der bruger service_tier="fast". Ultrafast-anmodninger bruger det separate niveau service_tier="ultrafast".
Hvordan sender jeg en Ultrafast-anmodning?
Hvis din organisation har adgang til Ultrafast, skal du bruge Responses API med:
Model:
gpt-6-astraServiceniveau:
ultrafastAnmodningsheader:
OpenAI-Service-Tier: ultrafast
Anmodningsheaderen er påkrævet ud over indstillingen for serviceniveau.
For applikationer, der udfører værktøjskald, gør WebSocket-tilstand det muligt at genbruge en forbindelse på tværs af samtalerunder og reducere ressourceforbruget til forbindelser.
Kan jeg bruge den samme anmodningsheader til andre serviceniveauer?
Under alfafasen for Ultrafast accepterer headeren OpenAI-Service-Tier kun ultrafast. Hvis du sender en anden værdi, herunder default, fast eller flex, returneres en HTTP 400-fejl. Udelad denne header, når du bruger et andet niveau.
Kan jeg bruge Ultrafast i Work eller Codex?
Ultrafast er også tilgængelig i Work og Codex for abonnementer og arbejdsområder, der opfylder betingelserne. Betingelserne for adgang og brug med ChatGPT-abonnementer er anderledes end for API-adgang.
Se ChatGPT Work og Codex for oplysninger om tilgængelighed og brug.
