OpenAI
Táto stránka bola strojovo preložená. Prečítaj si pôvodný článok v angličtine.

Časté otázky o rýchlom režime

Najčastejšie otázky o rýchlom režime a úrovni služby Ultrafast.

Aktualizované: 4 days ago

Zákazníkom API, ktorí chcú pri určitých modeloch rýchlejší a stabilnejší výkon, ponúkame rýchly režim. Nižšie nájdete odpovede na časté otázky o jeho fungovaní, cenách, dostupnosti modelov, limitoch požiadaviek, spoľahlivosti, pravidlách a podmienkach oprávnenosti.

Poznámka: Prioritné spracovanie bolo 30. júla 2026 premenované na rýchly režim. V požiadavkách API môžete použiť service_tier: priority aj service_tier: fast. 

Viac informácií nájdete tu.

Je rýchly režim dostupný vo všetkých regiónoch?

Dostupnosť rýchleho režimu závisí od platných zákonov a predpisov v jednotlivých jurisdikciách. Ak máte otázky týkajúce sa dostupnosti vo vašom regióne, obráťte sa na svojho riaditeľa pre zákaznícky účet.

Ako to funguje

Zákazníci môžu jednotlivé požiadavky smerovať do rýchleho režimu pomocou existujúceho parametra service_tier s nastavením service_tier = "fast".

Tokeny spracované v rýchlom režime sa účtujú za každý token, s príplatkom oproti sadzbám za štandardné spracovanie.

Okrem nastavenia pre jednotlivé požiadavky môžete rýchly režim nastaviť aj ako predvolený pre celý projekt v časti Nastavenia projektu > Predvolená úroveň služby: Rýchle. Pre jednotlivé požiadavky môžete toto nastavenie naďalej prepísať. Výber možnosti Rýchle v nastaveniach projektu je rovnocenný s výberom možnosti Prioritné.

Ako to funguje v kombinácii s úrovňou škálovania?

Úroveň škálovania zostane oddelená od rýchleho režimu. Požiadavky odoslané do rýchleho režimu sa budú účtovať samostatne a nebudú sa započítavať do zakúpených balíkov TPM v úrovni škálovania.

Môžem prevádzku prekračujúcu kapacitu úrovne škálovania automaticky presmerovať do rýchleho režimu?

Nie. Prevádzka odoslaná do úrovne škálovania sa pri prekročení kapacity automaticky nepresmeruje do rýchleho režimu.

Ako sa účtuje rýchly režim?

Tokeny spracované v rýchlom režime sa účtujú za každý token, s príplatkom oproti sadzbám za štandardné spracovanie.

Je môj ročný záväzok viazaný na konkrétny režim spracovania?

Nie. Výdavky za všetky režimy spracovania sa započítavajú do vášho ročného záväzku výdavkov v rámci zmluvy Enterprise.

Vzťahuje sa na vstupné tokeny vo vyrovnávacej pamäti aj naďalej zľava?

Áno! Na vstupy vo vyrovnávacej pamäti sa vzťahuje rovnaká zľava 50 – 75 % ako pri štandardnom spracovaní.

Ako si zobrazím využitie rýchleho režimu a výdavky naň?

Ak chcete zobraziť tokeny spracované v rýchlom režime (predtým prioritné spracovanie), prejdite na panel Využitie, vyberte Chat Completions alebo Responses a zvoľte Zoskupiť podľa úrovne služby.

Ak chcete zobraziť náklady na rýchly režim, prejdite na panel Využitie a vyberte Zoskupiť podľa položky.

Na paneli Využitie sa budú požiadavky s hodnotou priority alebo fast v parametri service_tier naďalej zobrazovať ako priority. Pre budúce modely sa toto zobrazenie aktualizuje.

Modely

Je rýchly režim dostupný aj pre dlhý kontext, doladené modely, embeddingy a podobne?

Zatiaľ nie. V budúcnosti zvážime, či rýchly režim ponúkneme aj pre ďalšie produkty, nielen pre naše najnovšie modely.

Ako fungujú ostatné modality v rýchlom režime?

Rýchly režim podporuje rovnaké multimodálne funkcie ako štandardné spracovanie. Ako vstupy pre prioritné spracovanie možno použiť najmä obrázky, ktoré sa spracúvajú s rovnako nízkou latenciou.

Budú podporované aj budúce modely?

Plánujeme ponúkať rýchly režim pre nové modely GPT, ale nezaručujeme podporu každého modelu.

Limity požiadaviek

Aké sú limity požiadaviek?

Z hľadiska limitov požiadaviek sa využívanie prioritného spracovania posudzuje rovnako ako štandardná prevádzka API.

Aké sú limity navýšenej rýchlosti?

Rýchly režim má limity navýšenej rýchlosti, ktoré zaisťujú stabilne vysoký výkon pre všetkých zákazníkov a zároveň umožňujú flexibilné účtovanie podľa spotreby. Ak (a) výkon rýchleho režimu klesne A ZÁROVEŇ (b) objem prevádzky zákazníka narastá príliš rýchlo, niektoré požiadavky môžu byť vo výnimočných prípadoch presunuté na štandardné spracovanie.

Aktuálny limit navýšenej rýchlosti pre rýchly režim je uvedený v našej hlavnej dokumentácii tu.

Odporúčané postupy na dodržanie limitu navýšenej rýchlosti

Pri zmene modelov zvyšujte objem prevádzky postupne. Ak napríklad vaša aplikácia prechádza z predchádzajúcej verzie modelu na novú, použite prepínač funkcie a presúvajte prevádzku v priebehu niekoľkých hodín, nie naraz.

Vyhnite sa používaniu rýchleho režimu na spracovanie veľkého objemu údajov alebo na asynchrónne úlohy. Tieto úlohy môžu veľmi rýchlo zvýšiť objem prevádzky a často nepotrebujú vyšší výkon rýchleho režimu.

Ak pravidelne narážate na limity navýšenej rýchlosti, zvážte radšej zakúpenie kvóty v úrovni škálovania.

Sú limity navýšenej rýchlosti spoločné pre všetky moje projekty alebo organizácie?

Áno, všetka vaša prevádzka sa započítava do rovnakého limitu navýšenej rýchlosti.

Pravidlá

Čo sa stane, ak rýchly režim nedosahuje cieľovú latenciu?

S akýmikoľvek otázkami alebo obavami sa obráťte na svojho AD. Na dohody SLA pre rýchly režim sa budú vzťahovať rovnaké podmienky ako na dohody SLA pre úroveň škálovania. Ak u zákazníkov so zmluvami Enterprise v danom časovom intervale tieto dohody SLA nedodržíme, ponúkneme im kredity na služby.

Je rýchly režim kompatibilný s rezidenciou údajov?

Áno.

Je rýchly režim kompatibilný so ZDR a dohodou BAA?

Áno.

Ultrafast pre GPT-6 Astra

Ultrafast je samostatná úroveň služby pre úlohy, ktoré vyžadujú odpovede modelu GPT-6 Astra s nižšou latenciou, napríklad interaktívne aplikácie a pracovné postupy pri programovaní.

Informácie o cenách, limitoch požiadaviek a pravidlách rýchleho režimu sa vzťahujú na požiadavky s nastavením service_tier="fast". Požiadavky Ultrafast používajú samostatnú úroveň service_tier="ultrafast".

Ako odošlem požiadavku Ultrafast?

Ak má vaša organizácia prístup k Ultrafast, použite Responses API s týmito nastaveniami:

  • Model: gpt-6-astra

  • Úroveň služby: ultrafast

  • Hlavička požiadavky: OpenAI-Service-Tier: ultrafast

Okrem nastavenia úrovne služby je povinná aj hlavička požiadavky.

V aplikáciách, ktoré vykonávajú volania nástrojov, umožňuje režim WebSocket opakovane používať jedno pripojenie v rámci viacerých kôl konverzácie a znížiť tak réžiu spojenú s pripájaním.

Môžem rovnakú hlavičku požiadavky použiť aj pre iné úrovne služby?

Počas alfa fázy Ultrafast prijíma hlavička OpenAI-Service-Tier iba hodnotu ultrafast. Odoslanie inej hodnoty vrátane default, fast alebo flex vráti chybu HTTP 400. Pri používaní inej úrovne túto hlavičku vynechajte.

Môžem Ultrafast používať v režime Work alebo v nástroji Codex?

Ultrafast je k dispozícii aj v režime Work a v nástroji Codex pre oprávnené programy a pracovné priestory. Podmienky dostupnosti a používania v programoch ChatGPT sa líšia od podmienok prístupu cez API.

Podrobnosti o dostupnosti a používaní nájdete v článku ChatGPT Work a Codex.

Bol tento článok užitočný?