OpenAI
Denne siden ble maskinoversatt. Se den opprinnelige engelske artikkelen.

Vanlige spørsmål om Hurtigmodus

Vanlige spørsmål om Hurtigmodus og tjenestenivået Ultrafast.

Oppdatert: 4 days ago

Vi tilbyr Hurtigmodus til API-kunder som ønsker raskere og mer stabil ytelse på enkelte modeller. Nedenfor finner du svar på vanlige spørsmål om hvordan det fungerer, priser, modelltilgjengelighet, bruksgrenser, driftssikkerhet, retningslinjer og kvalifikasjonskrav.

Merk: Priority processing fikk navnet Hurtigmodus 30. juli 2026. Du kan bruke enten service_tier: priority eller service_tier: fast i API-forespørslene dine. 

Finn ut mer her.

Er Hurtigmodus tilgjengelig i alle regioner?

Tilgjengeligheten av Hurtigmodus avhenger av gjeldende lover og forskrifter i hver jurisdiksjon. Ta kontakt med den kundeansvarlige hvis du har spørsmål om tilgjengeligheten i din region.

Slik fungerer det

Kunder kan sende trafikk til Hurtigmodus for hver enkelt forespørsel ved å bruke den eksisterende service_tier-parameteren med alternativet service_tier = "fast".

Token som behandles i Hurtigmodus, faktureres per token til en høyere pris enn ved standardbehandling.

I tillegg til å velge Hurtigmodus for hver enkelt forespørsel kan du angi det som standard for et prosjekt under Prosjektinnstillinger > Standard tjenestenivå: Hurtig. Du kan fortsatt overstyre dette for hver enkelt forespørsel. Å velge Hurtig i prosjektinnstillingene tilsvarer å velge Prioritet.

Hvordan fungerer dette sammen med Skaleringsnivå?

Skaleringsnivå vil fortsatt være atskilt fra Hurtigmodus. Forespørsler som sendes til Hurtigmodus, faktureres separat og trekkes ikke fra TPM-pakkene du har kjøpt på Skaleringsnivå.

Kan jeg automatisk sende trafikk som overstiger kvoten på Skaleringsnivå, til Hurtigmodus?

Nei. Trafikk som sendes til Skaleringsnivå, overføres ikke automatisk til Hurtigmodus når kvoten overskrides.

Hvordan faktureres Hurtigmodus?

Token som behandles i Hurtigmodus, faktureres per token til en høyere pris enn ved standardbehandling.

Er den årlige forbruksforpliktelsen min knyttet til en bestemt behandlingsmodus?

Nei. Alle behandlingsmoduser teller med i den årlige forbruksforpliktelsen din for Enterprise.

Får jeg fortsatt rabatt på hurtigbufrede inndatatoken?

Ja! Hurtigbufrede inndata får samme rabatt på 50–75 % som ved standardbehandling.

Hvordan ser jeg bruken og kostnadene mine for Hurtigmodus?

For å se token som er behandlet i Hurtigmodus (tidligere kalt prioritert behandling), går du til bruksoversikten, velger Chat Completions eller Responses og grupperer etter tjenestenivå.

For å se kostnadene for Hurtigmodus går du til bruksoversikten og velger Grupper etter fakturalinje.

I bruksoversikten vil forespørsler som bruker enten priority eller fast som service_tier, fortsatt vises som priority. Dette vil bli oppdatert for fremtidige modeller.

Modeller

Er Hurtigmodus tilgjengelig for lang kontekst, finjusterte modeller, vektorrepresentasjoner osv.?

Ikke foreløpig. Vi vil fremover vurdere å tilby Hurtigmodus for flere produkter enn de nyeste modellene våre.

Hvordan fungerer andre modaliteter med Hurtigmodus?

Hurtigmodus støtter de samme multimodale funksjonene som Standard. Bilder kan for eksempel brukes som inndata ved prioritert behandling og behandles med den samme lave latensen.

Vil fremtidige modeller støttes?

Vi planlegger å tilby Hurtigmodus for nye GPT-modeller, men vi garanterer ikke at alle modeller vil støttes.

Bruksgrenser

Hva er bruksgrensene?

Forbruk ved prioritert behandling regnes på samme måte som standard API-trafikk når det gjelder bruksgrenser.

Hva er grensene for opptrappingshastighet?

Hurtigmodus har grenser for opptrappingshastighet for å sikre jevnt høy ytelse for alle kunder, samtidig som prisingen er fleksibel og basert på faktisk bruk. Hvis (a) ytelsen i Hurtigmodus er redusert OG (b) en kundes trafikk øker for raskt, kan enkelte forespørsler i sjeldne tilfeller bli nedgradert til standardbehandling.

Den gjeldende grensen for opptrappingshastighet i Hurtigmodus er definert i hoveddokumentasjonen vår her.

Anbefalt praksis for å holde deg innenfor grensen for opptrappingshastighet

Øk trafikken gradvis når du bytter modell. Hvis applikasjonen din for eksempel går over fra en tidligere modellversjon til en ny, kan du bruke et funksjonsflagg til å flytte trafikken over i løpet av noen timer i stedet for alt på én gang.

Unngå å kjøre store databehandlingsjobber eller asynkrone jobber i Hurtigmodus. Disse jobbene kan øke trafikken svært raskt og trenger ofte ikke den forbedrede ytelsen i Hurtigmodus.

Hvis du ofte når grensene for opptrappingshastighet, bør du vurdere å kjøpe kvote på Skaleringsnivå i stedet.

Er grensene for opptrappingshastighet felles for prosjektene eller organisasjonene mine?

Ja, all trafikken din teller mot samme grense for opptrappingshastighet.

Retningslinjer

Hva skjer hvis Hurtigmodus ikke oppfyller latensmålet?

Ta kontakt med din AD hvis du har spørsmål eller bekymringer. SLA-er for Hurtigmodus håndteres på samme måte som SLA-er for Skaleringsnivå. Kunder med Enterprise-avtaler får tilbud om tjenestekreditter hvis vi ikke oppfyller disse SLA-ene i en gitt tidsperiode.

Er Hurtigmodus kompatibel med dataresidens?

Ja.

Er Hurtigmodus kompatibel med ZDR og BAA?

Ja.

Ultrafast for GPT-6 Astra

Ultrafast er et eget tjenestenivå for arbeidsbelastninger som krever svar fra GPT-6 Astra med lavere latens, for eksempel interaktive applikasjoner og arbeidsflyter for koding.

Prisene, bruksgrensene og retningslinjene for Hurtigmodus gjelder for forespørsler som bruker service_tier="fast". Ultrafast-forespørsler bruker det separate nivået service_tier="ultrafast".

Hvordan sender jeg en Ultrafast-forespørsel?

For en organisasjon med Ultrafast-tilgang bruker du Responses API med:

  • Modell: gpt-6-astra

  • Tjenestenivå: ultrafast

  • Forespørselsheader: OpenAI-Service-Tier: ultrafast

Forespørselsheaderen kreves i tillegg til innstillingen for tjenestenivå.

For applikasjoner som utfører verktøykall, lar WebSocket-modus deg gjenbruke en tilkobling på tvers av samtalerunder og redusere ressursbruken knyttet til tilkoblinger.

Kan jeg bruke den samme forespørselsheaderen for andre tjenestenivåer?

I alfafasen for Ultrafast godtar headeren OpenAI-Service-Tier bare ultrafast. Hvis du sender en annen verdi, inkludert default, fast eller flex, returneres en HTTP 400-feil. Utelat denne headeren når du bruker et annet nivå.

Kan jeg bruke Ultrafast i Work eller Codex?

Ultrafast er også tilgjengelig i Work og Codex for kvalifiserte abonnementer og arbeidsområder. Kravene til ChatGPT-abonnement og bruk er annerledes enn for API-tilgang.

Se ChatGPT Work og Codex for detaljer om tilgjengelighet og bruk.

Var denne artikkelen nyttig?