API klientiem, kuri vēlas noteiktiem modeļiem nodrošināt ātrāku un vienmērīgāku veiktspēju, piedāvājam Ātro režīmu. Tālāk sniegtas atbildes uz bieži uzdotiem jautājumiem par tā darbību, cenām, modeļu pieejamību, darbības ierobežojumiem, uzticamību, politikām un atbilstības prasībām.
Piezīme. 2026. gada 30. jūlijā prioritārā apstrāde tika pārdēvēta par Ātro režīmu. API pieprasījumos varat izmantot gan service_tier: priority, gan service_tier: fast.
Uzziniet vairāk šeit.
Vai Ātrais režīms ir pieejams visos reģionos?
Ātrā režīma pieejamība ir atkarīga no katrā jurisdikcijā piemērojamajiem tiesību aktiem un noteikumiem. Ja jums ir jautājumi par pieejamību savā reģionā, sazinieties ar savu klientu konta vadītāju.
Kā tas darbojas
Klienti var novirzīt atsevišķus pieprasījumus uz Ātro režīmu, izmantojot esošo parametru service_tier ar iestatījumu service_tier = "fast".
Par Ātrajā režīmā apstrādātajām tekstvienībām maksa tiks aprēķināta par katru tekstvienību, piemērojot augstāku tarifu nekā standarta apstrādē.
Papildus iestatīšanai atsevišķiem pieprasījumiem Ātro režīmu var iestatīt arī kā projekta noklusējuma režīmu sadaļā Projekta iestatījumi > Noklusējuma pakalpojuma līmenis: Ātrais. Šo iestatījumu joprojām var mainīt katram pieprasījumam atsevišķi. Izvēloties projekta iestatījumos opciju “Ātrais”, tiek iegūts tāds pats rezultāts kā ar opciju “Prioritārais”.
Kā Ātrais režīms ir saistīts ar Mēroga līmeni?
Mēroga līmenis arī turpmāk būs atsevišķs no Ātrā režīma. Par pieprasījumiem, kas nosūtīti uz Ātro režīmu, maksa tiks aprēķināta atsevišķi, un tie netiks ieskaitīti jūsu iegādātajās Mēroga līmeņa TPM pakotnēs.
Vai pieprasījumus, kas pārsniedz Mēroga līmeņa kvotu, var automātiski novirzīt uz Ātro režīmu?
Nē. Uz Mēroga līmeni nosūtītie pieprasījumi, kas pārsniedz tā kvotu, netiks automātiski novirzīti uz Ātro režīmu.
Kā tiek aprēķināta maksa par Ātro režīmu?
Par Ātrajā režīmā apstrādātajām tekstvienībām maksa tiks aprēķināta par katru tekstvienību, piemērojot augstāku tarifu nekā standarta apstrādē.
Vai manas gada tēriņu saistības attiecas uz konkrētu apstrādes režīmu?
Nē. Visu apstrādes režīmu izmaksas tiek ieskaitītas jūsu Enterprise līgumā noteiktajā gada tēriņu apjomā.
Vai kešatmiņā saglabātajām ievades tekstvienībām joprojām tiek piemērota atlaide?
Jā! Kešatmiņā saglabātajiem ievades datiem tiek piemērota tāda pati 50–75 % atlaide kā standarta apstrādē.
Kā apskatīt Ātrā režīma lietojumu un izmaksas?
Lai apskatītu Ātrajā režīmā (iepriekš — prioritārā apstrāde) apstrādātās tekstvienības, atveriet lietojuma informācijas paneli, atlasiet Chat Completions vai Responses un izvēlieties grupēšanu pēc pakalpojuma līmeņa.
Lai apskatītu Ātrā režīma izmaksas, atveriet lietojuma informācijas paneli un izvēlieties grupēšanu pēc rēķina pozīcijas.
Lietojuma informācijas panelī pieprasījumi, kuros service_tier vērtība ir priority vai fast, joprojām tiks rādīti kā priority. Turpmākajiem modeļiem šis attēlojums tiks atjaunināts.
Modeļi
Vai Ātrais režīms ir pieejams garam kontekstam, precīzi pielāgotiem modeļiem, iegulumiem u. c.?
Pašlaik ne. Nākotnē izvērtēsim, vai piedāvāt Ātro režīmu arī citos produktos, ne tikai mūsu jaunākajos modeļos.
Kā Ātrajā režīmā darbojas citas modalitātes?
Ātrais režīms atbalsta tās pašas multimodālās iespējas, kas pieejamas standarta apstrādē. Piemēram, prioritārajā apstrādē kā ievades datus var izmantot attēlus, un tie tiek apstrādāti ar tikpat mazu aizkavi.
Vai tiks atbalstīti arī turpmākie modeļi?
Plānojam piedāvāt Ātro režīmu jaunajos GPT modeļos, taču negarantējam, ka tiks atbalstīts katrs modelis.
Darbības ierobežojumi
Kādi ir darbības ierobežojumi?
Darbības ierobežojumu uzskaitē prioritārās apstrādes lietojums tiek vērtēts tāpat kā standarta API pieprasījumu plūsma.
Kādi ir pieauguma ātruma ierobežojumi?
Ātrajam režīmam ir pieauguma ātruma ierobežojumi, lai nodrošinātu nemainīgi augstu veiktspēju visiem klientiem, vienlaikus saglabājot elastīgu maksu atbilstoši lietojumam. Ja (a) Ātrā režīma veiktspēja pasliktinās UN (b) klienta pieprasījumu plūsma pieaug pārāk strauji, retos gadījumos dažus pieprasījumus var pārvirzīt uz standarta apstrādi.
Pašreizējais Ātrā režīma pieauguma ātruma ierobežojums ir norādīts mūsu galvenajā dokumentācijā šeit.
Ieteikumi, kā nepārsniegt pieauguma ātruma ierobežojumu
Mainot modeli, palieliniet pieprasījumu plūsmu pakāpeniski. Piemēram, ja jūsu lietotne pāriet no iepriekšējās modeļa fiksētās versijas uz jaunu, izmantojiet funkcijas karodziņu, lai pārvirzītu pieprasījumu plūsmu dažu stundu laikā, nevis visu uzreiz.
Neizmantojiet Ātro režīmu apjomīgai datu apstrādei vai asinhroniem uzdevumiem. Šie uzdevumi var ļoti strauji palielināt pieprasījumu plūsmu, un tiem bieži vien nav vajadzīga Ātrā režīma uzlabotā veiktspēja.
Ja regulāri sasniedzat pieauguma ātruma ierobežojumus, apsveriet iespēju tā vietā iegādāties Mēroga līmeņa kvotu.
Vai pieauguma ātruma ierobežojumi ir kopīgi visiem maniem projektiem vai organizācijām?
Jā, visa jūsu pieprasījumu plūsma tiek ieskaitīta vienā kopīgā pieauguma ātruma ierobežojumā.
Politikas
Kas notiek, ja Ātrā režīma aizkave pārsniedz mērķa vērtību?
Ja jums ir jautājumi vai bažas, sazinieties ar savu klientu attiecību vadītāju (AD). Ātrā režīma SLA tiks piemēroti tāpat kā Mēroga līmeņa SLA: ja noteiktā laika periodā neizpildīsim šīs saistības pret klientiem ar Enterprise līgumiem, piedāvāsim pakalpojuma kredītus.
Vai Ātrais režīms ir saderīgs ar datu rezidences vietas prasībām?
Jā.
Vai Ātrais režīms ir saderīgs ar ZDR un BAA?
Jā.
Ultrafast modelim GPT-6 Astra
Ultrafast ir atsevišķs pakalpojuma līmenis uzdevumiem, kuros vajadzīgas GPT-6 Astra atbildes ar mazāku aizkavi, piemēram, interaktīvām lietotnēm un programmēšanas darbplūsmām.
Ātrā režīma cenas, darbības ierobežojumi un politiku vadlīnijas attiecas uz pieprasījumiem, kuros izmantots service_tier="fast". Ultrafast pieprasījumi izmanto atsevišķu līmeni service_tier="ultrafast".
Kā nosūtīt Ultrafast pieprasījumu?
Ja organizācijai ir piekļuve Ultrafast, izmantojiet Responses API ar šādiem iestatījumiem:
Modelis:
gpt-6-astraPakalpojuma līmenis:
ultrafastPieprasījuma galvene:
OpenAI-Service-Tier: ultrafast
Papildus pakalpojuma līmeņa iestatījumam obligāti jānorāda arī pieprasījuma galvene.
Lietotnēs, kas izpilda rīku izsaukumus, WebSocket režīms ļauj atkārtoti izmantot savienojumu vairākos sarunas gājienos un samazināt savienojuma izveides resursu patēriņu.
Vai to pašu pieprasījuma galveni var izmantot citiem pakalpojuma līmeņiem?
Ultrafast alfa versijā galvene OpenAI-Service-Tier pieņem tikai vērtību ultrafast. Nosūtot citu vērtību, tostarp default, fast vai flex, tiek atgriezta HTTP 400 kļūda. Izmantojot citu līmeni, šo galveni nenorādiet.
Vai Ultrafast var izmantot režīmā Work vai Codex?
Ultrafast ir pieejams arī režīmā Work un Codex atbilstošajiem plāniem un darbvietām. Pieejamības un lietošanas nosacījumi ChatGPT plānos atšķiras no API piekļuves nosacījumiem.
Plašāku informāciju par pieejamību un lietošanu skatiet rakstā ChatGPT Work un Codex.
