Zákazníkům API, kteří chtějí u vybraných modelů rychlejší a stabilnější výkon, nabízíme Rychlý režim. Níže najdete odpovědi na časté otázky o fungování, cenách, dostupnosti modelů, limitech frekvence požadavků, spolehlivosti, zásadách a podmínkách využití.
Poznámka: Prioritní zpracování bylo 30. července 2026 přejmenováno na Rychlý režim. V požadavcích API můžete použít service_tier: priority i service_tier: fast.
Další informace najdete zde.
Je Rychlý režim dostupný ve všech regionech?
Dostupnost Rychlého režimu závisí na příslušných zákonech a předpisech v dané jurisdikci. S dotazy ohledně dostupnosti ve vašem regionu se obraťte na svého obchodního zástupce.
Jak to funguje
Zákazníci mohou směrovat jednotlivé požadavky do Rychlého režimu pomocí stávajícího parametru service_tier s nastavením service_tier = "fast".
Tokeny zpracované v Rychlém režimu se účtují jednotlivě, za vyšší sazbu než při standardním zpracování.
Kromě nastavení u jednotlivých požadavků můžete Rychlý režim nastavit i jako výchozí pro celý projekt v části Nastavení projektu > Výchozí úroveň služeb: Rychlá. U jednotlivých požadavků můžete toto nastavení nadále přepsat. Volba Rychlá v nastavení projektu odpovídá volbě Prioritní.
Jaký je vztah k úrovni škálování?
Úroveň škálování zůstane od Rychlého režimu oddělená. Požadavky odeslané do Rychlého režimu se účtují samostatně a nečerpají zakoupené balíčky TPM úrovně škálování.
Můžu provoz přesahující kapacitu úrovně škálování automaticky směrovat do Rychlého režimu?
Ne. Provoz odeslaný do úrovně škálování se při překročení kapacity automaticky nepřesměruje do Rychlého režimu.
Jak se Rychlý režim účtuje?
Tokeny zpracované v Rychlém režimu se účtují jednotlivě, za vyšší sazbu než při standardním zpracování.
Je můj roční závazek vázán na konkrétní režim zpracování?
Ne. Do vašeho ročního závazku útraty v rámci Enterprise se započítávají všechny režimy zpracování.
Dostanu i nadále slevu na vstupní tokeny uložené v mezipaměti?
Ano! Na vstupy uložené v mezipaměti se vztahuje stejná sleva 50–75 % jako při standardním zpracování.
Jak si zobrazím využití a náklady Rychlého režimu?
Tokeny zpracované v Rychlém režimu (dříve prioritní zpracování) zobrazíte tak, že přejdete na panel Využití, vyberete Chat Completions nebo Responses a zvolíte Seskupit podle úrovně služeb.
Náklady na Rychlý režim zobrazíte na panelu Využití výběrem možnosti Seskupit podle položky.
Na panelu Využití se požadavky s hodnotou priority nebo fast v parametru service_tier budou i nadále zobrazovat jako priority. U budoucích modelů bude toto zobrazení aktualizováno.
Modely
Je Rychlý režim dostupný pro dlouhý kontext, doladěné modely, embeddingy atd.?
Zatím ne. V budoucnu zvážíme, zda Rychlý režim nabídneme i u dalších produktů kromě našich nejnovějších modelů.
Jak v Rychlém režimu fungují ostatní modality?
Rychlý režim podporuje stejné multimodální funkce jako standardní zpracování. Jako vstupy pro prioritní zpracování lze využít zejména obrázky, které se zpracovávají se stejně nízkou latencí.
Budou podporovány i budoucí modely?
Plánujeme nabídnout Rychlý režim i u nových modelů GPT, ale nezaručujeme podporu všech modelů.
Limity frekvence požadavků
Jaké jsou limity frekvence požadavků?
Využití prioritního zpracování se do limitů frekvence požadavků započítává stejně jako standardní provoz API.
Jaké jsou limity tempa nárůstu?
Rychlý režim má limity tempa nárůstu, aby zajistil trvale vysoký výkon všem zákazníkům a zároveň umožnil flexibilní účtování podle spotřeby. Pokud (a) dojde ke snížení výkonu Rychlého režimu A ZÁROVEŇ (b) provoz zákazníka narůstá příliš rychle, mohou být ve vzácných případech některé požadavky převedeny na standardní zpracování.
Aktuální limit tempa nárůstu pro Rychlý režim je uveden zde v naší hlavní dokumentaci.
Doporučené postupy, jak nepřekročit limit tempa nárůstu
Při změně modelů zvyšujte provoz postupně. Pokud například vaše aplikace přechází z předchozího snapshotu na nový, použijte příznak funkce a převádějte provoz postupně během několika hodin, nikoli najednou.
V Rychlém režimu nespouštějte rozsáhlé úlohy zpracování dat ani asynchronní úlohy. Tyto úlohy mohou způsobit velmi rychlý nárůst provozu a často nepotřebují vyšší výkon Rychlého režimu.
Pokud pravidelně narážíte na limity tempa nárůstu, zvažte místo toho nákup kvóty v úrovni škálování.
Jsou limity tempa nárůstu sdílené mezi mými projekty nebo organizacemi?
Ano, veškerý váš provoz se započítává do stejného limitu tempa nárůstu.
Zásady
Co se stane, když Rychlý režim nedosahuje cílové latence?
S případnými dotazy nebo problémy se obraťte na svého obchodního zástupce (AD). Na SLA pro Rychlý režim se budou vztahovat stejná pravidla jako na SLA pro úroveň škálování. Pokud tyto SLA v daném časovém období nesplníme, nabídneme zákazníkům se smlouvami Enterprise kredity na služby.
Je Rychlý režim kompatibilní s datovou rezidencí?
Ano.
Je Rychlý režim kompatibilní se ZDR a smlouvou BAA?
Ano.
Ultrafast pro GPT-6 Astra
Ultrafast je samostatná úroveň služeb pro úlohy, které vyžadují odpovědi modelu GPT-6 Astra s nižší latencí, například interaktivní aplikace a programátorské pracovní postupy.
Ceny, limity frekvence požadavků a pokyny k zásadám pro Rychlý režim se vztahují na požadavky s nastavením service_tier="fast". Požadavky Ultrafast používají samostatnou úroveň service_tier="ultrafast".
Jak odešlu požadavek Ultrafast?
Pokud má vaše organizace přístup k Ultrafast, použijte Responses API s tímto nastavením:
Model:
gpt-6-astraÚroveň služeb:
ultrafastHlavička požadavku:
OpenAI-Service-Tier: ultrafast
Kromě nastavení úrovně služeb je nutné uvést i tuto hlavičku požadavku.
Aplikacím, které volají nástroje, umožňuje režim WebSocket opakovaně používat spojení mezi jednotlivými tahy a snížit režii navazování spojení.
Můžu stejnou hlavičku požadavku použít i pro jiné úrovně služeb?
V alfa verzi Ultrafast přijímá hlavička OpenAI-Service-Tier pouze hodnotu ultrafast. Odeslání jiné hodnoty, včetně default, fast nebo flex, vrátí chybu HTTP 400. Při použití jiné úrovně tuto hlavičku vynechte.
Můžu Ultrafast používat v režimu Work nebo v Codex?
Ultrafast je k dispozici také v režimu Work a v Codex pro tarify a pracovní prostory, které splňují podmínky. Podmínky dostupnosti a využití v tarifech ChatGPT se liší od přístupu přes API.
Podrobnosti o dostupnosti a využití najdete v článku ChatGPT Work a Codex.
