OpenAI
Тази страница е машинно преведена. Вижте оригиналната статия на английски език.

ЧЗВ за Бърз режим

Често задавани въпроси за Бърз режим и нивото на услугата Ultrafast.

Актуализирано: 4 days ago

Предлагаме Бърз режим за клиенти на API, които искат по-бърза и по-постоянна производителност при определени модели. По-долу ще намерите отговори на често задавани въпроси за начина на работа, цените, наличността на моделите, лимитите на заявките, надеждността, правилата и условията за достъп.

Забележка: На 30 юли 2026 г. „Приоритетна обработка“ беше преименувана на „Бърз режим“. В заявките си към API можете да използвате service_tier: priority или service_tier: fast. 

Научете повече тук.

Предлага ли се Бърз режим във всички региони?

Достъпът до Бърз режим зависи от приложимите закони и разпоредби във всяка юрисдикция. Ако имате въпроси относно наличността във вашия регион, свържете се с директора, отговарящ за вашия акаунт.

Как работи

Клиентите могат да насочват отделни заявки към Бърз режим чрез съществуващия параметър service_tier с опцията service_tier = "fast".

Токените, обработени в Бърз режим, се таксуват на токен, по по-висока цена от тази за стандартна обработка.

Освен за отделни заявки можете да зададете Бърз режим и като режим по подразбиране за проект в „Настройки на проекта“ > „Ниво на услугата по подразбиране: Бърз“. Все пак можете да променяте тази настройка за отделни заявки. Изборът на „Бърз“ в настройките на проекта е равнозначен на избора на „Приоритетен“.

Как се съчетава това с Ниво на мащабиране?

Ниво на мащабиране ще остане отделно от Бърз режим. Заявките, изпратени към Бърз режим, ще се таксуват отделно и няма да изразходват закупените от вас пакети токени в минута (TPM) за Ниво на мащабиране.

Мога ли автоматично да пренасочвам към Бърз режим трафика, който надхвърля квотата ми за Ниво на мащабиране?

Не. Трафикът, изпратен към Ниво на мащабиране, няма автоматично да се пренасочва към Бърз режим при надхвърляне на квотата.

Как се таксува Бърз режим?

Токените, обработени в Бърз режим, се таксуват на токен, по по-висока цена от тази за стандартна обработка.

Обвързан ли е годишният ми ангажимент с конкретен режим на обработка?

Не. Разходите за всички режими на обработка се отчитат към годишния ви ангажимент за разходи по Enterprise.

Продължавам ли да получавам отстъпка за кешираните входни токени?

Да! За кешираните входни данни се прилага същата отстъпка от 50–75%, както при стандартната обработка.

Как да видя потреблението и разходите си за Бърз режим?

За да видите токените, обработени в Бърз режим (преди наричан „Приоритетна обработка“), отворете таблото „Потребление“, изберете Chat Completions или Responses и „Групиране по ниво на услугата“.

За да видите разходите за Бърз режим, отворете таблото „Потребление“ и изберете „Групиране по разходна позиция“.

В таблото „Потребление“ заявките със стойност priority или fast за service_tier ще продължат да се показват като priority. Това ще бъде актуализирано за бъдещите модели.

Модели

Предлага ли се Бърз режим за дълъг контекст, фино настроени модели, векторни представяния и т.н.?

Засега не. В бъдеще ще преценим дали да предлагаме Бърз режим и за други продукти освен най-новите ни модели.

Как работят другите модалности с Бърз режим?

Бърз режим поддържа същите мултимодални възможности като стандартната обработка. По-конкретно, изображенията могат да се използват като входни данни за приоритетна обработка и се обработват със същата ниска латентност.

Ще се поддържат ли бъдещи модели?

Планираме да предлагаме Бърз режим за новите GPT модели, но не гарантираме, че всеки модел ще се поддържа.

Лимити на заявките

Какви са лимитите на заявките?

По отношение на лимитите на заявките потреблението при приоритетна обработка се отчита по същия начин като стандартния API трафик.

Какви са ограниченията за скоростта на нарастване?

Бърз режим има ограничения за скоростта на нарастване, за да осигурява постоянно висока производителност за всички клиенти, като същевременно предлага гъвкаво ценообразуване според потреблението. Ако (а) производителността на Бърз режим е влошена И (б) трафикът на даден клиент нараства твърде бързо, в редки случаи някои заявки може да бъдат пренасочени към стандартна обработка.

Текущото ограничение за скоростта на нарастване в Бърз режим е посочено тук, в основната ни документация.

Добри практики за спазване на ограничението за скоростта на нарастване

Увеличавайте трафика постепенно при смяна на модели. Например, ако приложението ви преминава от предишна фиксирана версия на модела към нова, използвайте флаг за функционалност, за да пренасочите трафика в рамките на няколко часа, а не наведнъж.

Избягвайте да изпълнявате задачи за обработка на големи обеми данни или асинхронни задачи в Бърз режим. Тези задачи могат много бързо да увеличат трафика и често не се нуждаят от по-високата производителност на Бърз режим.

Ако редовно достигате ограниченията за скоростта на нарастване, обмислете вместо това да закупите квота за Ниво на мащабиране.

Общи ли са ограниченията за скоростта на нарастване за моите проекти или организации?

Да, целият ви трафик се отчита спрямо едно и също ограничение за скоростта на нарастване.

Политики

Какво се случва, ако Бърз режим не постига целевата латентност?

При въпроси или притеснения се свържете с вашия AD. За споразуменията за ниво на обслужване (SLA) на Бърз режим ще важат същите условия като за SLA на Ниво на мащабиране. Ако не изпълним тези споразумения за клиентите с договори Enterprise в рамките на даден период, ще предложим компенсационни кредити за услугата.

Съвместим ли е Бърз режим с изискванията за местонахождение на данните?

Да.

Съвместим ли е Бърз режим със ZDR и BAA?

Да.

Ultrafast за GPT-6 Astra

Ultrafast е отделно ниво на услугата за задачи, които изискват отговори от GPT-6 Astra с по-ниска латентност, като интерактивни приложения и работни процеси за програмиране.

Указанията за ценообразуване, лимити на заявките и политики за Бърз режим важат за заявки, използващи service_tier="fast". Заявките към Ultrafast използват отделното ниво service_tier="ultrafast".

Как да изпратя заявка към Ultrafast?

За организация с достъп до Ultrafast използвайте Responses API със следните настройки:

  • Модел: gpt-6-astra

  • Ниво на услугата: ultrafast

  • Заглавно поле на заявката: OpenAI-Service-Tier: ultrafast

Освен настройката за ниво на услугата е необходимо и заглавното поле на заявката.

За приложения, които извикват инструменти, режимът WebSocket позволява повторно използване на една връзка в последователните стъпки на разговора, като намалява разходите за установяване на връзки.

Мога ли да използвам същото заглавно поле на заявката за други нива на услугата?

По време на алфа версията на Ultrafast заглавното поле OpenAI-Service-Tier приема само ultrafast. Изпращането на друга стойност, включително default, fast или flex, връща грешка HTTP 400. Не включвайте това заглавно поле, когато използвате друго ниво.

Мога ли да използвам Ultrafast в Work или Codex?

Ultrafast се предлага и в Work и Codex за планове и работни пространства, които отговарят на условията. Условията за достъп и използване при плановете на ChatGPT се различават от тези за API.

Вижте ChatGPT Work и Codex за подробности относно наличността и използването.

Беше ли Ви полезна тази статия?