Ми пропонуємо Швидкий режим клієнтам API, яким потрібна вища й стабільніша швидкість роботи певних моделей. Нижче наведено відповіді на поширені запитання про принцип роботи, ціни, доступність моделей, ліміти запитів, надійність, правила та критерії участі.
Примітка. 30 липня 2026 року «Пріоритетну обробку» було перейменовано на «Швидкий режим». У запитах API можна використовувати як service_tier: priority, так і service_tier: fast.
Докладніше — за посиланням.
Чи доступний Швидкий режим у всіх регіонах?
Доступність Швидкого режиму залежить від законів і нормативних вимог, чинних у кожній юрисдикції. Якщо у вас є запитання щодо доступності у вашому регіоні, зверніться до директора по роботі з клієнтами.
Як це працює
Клієнти можуть спрямовувати окремі запити до Швидкого режиму за допомогою наявного параметра service_tier, задавши service_tier = "fast".
Токени, оброблені у Швидкому режимі, оплачуватимуться за кожен токен за вищими тарифами, ніж за стандартної обробки.
Швидкий режим можна налаштувати не лише для окремих запитів, а й як типовий для проєкту: Налаштування проєкту > Рівень обслуговування за замовчуванням: Швидкий. Це налаштування й надалі можна перевизначати для окремих запитів. Вибір «Швидкий» у налаштуваннях проєкту рівнозначний вибору «Пріоритетний».
Як це поєднується з Рівнем масштабування?
Рівень масштабування залишиться окремим від Швидкого режиму. Запити, спрямовані до Швидкого режиму, оплачуватимуться окремо й не використовуватимуть придбані вами пакети токенів за хвилину (TPM) Рівня масштабування.
Чи можна автоматично спрямовувати трафік понад квоту Рівня масштабування до Швидкого режиму?
Ні. Трафік, спрямований до Рівня масштабування, не перенаправлятиметься автоматично до Швидкого режиму в разі перевищення квоти.
Як оплачується Швидкий режим?
Токени, оброблені у Швидкому режимі, оплачуватимуться за кожен токен за вищими тарифами, ніж за стандартної обробки.
Чи прив’язане моє річне зобов’язання щодо витрат до певного режиму обробки?
Ні. Витрати на всі режими обробки зараховуються до вашого річного зобов’язання щодо витрат за угодою Enterprise.
Чи зберігається знижка на кешовані вхідні токени?
Так! На кешовані вхідні дані діє та сама знижка 50–75%, що й за стандартної обробки.
Як переглянути використання Швидкого режиму та витрати на нього?
Щоб переглянути токени, оброблені у Швидкому режимі (раніше — пріоритетна обробка), відкрийте панель використання, виберіть Chat Completions або Responses і згрупуйте дані за рівнем обслуговування.
Щоб переглянути витрати на Швидкий режим, відкрийте панель використання та виберіть групування за статтями витрат.
На панелі використання запити зі значенням priority або fast у параметрі service_tier і надалі відображатимуться як priority. Для майбутніх моделей це відображення буде оновлено.
Моделі
Чи доступний Швидкий режим для довгого контексту, донавчених моделей, ембедингів тощо?
Наразі ні. У майбутньому ми розглянемо можливість запровадити Швидкий режим і для інших продуктів, окрім наших найновіших моделей.
Як Швидкий режим працює з іншими модальностями?
Швидкий режим підтримує ті самі мультимодальні можливості, що й стандартна обробка. Зокрема, зображення можна передавати як вхідні дані для пріоритетної обробки — вони обробляються з такою самою низькою затримкою.
Чи підтримуватимуться майбутні моделі?
Ми плануємо пропонувати Швидкий режим для нових моделей GPT, але не гарантуємо підтримку кожної моделі.
Ліміти запитів
Які діють ліміти запитів?
Для лімітів запитів використання пріоритетної обробки враховується так само, як стандартний трафік API.
Які діють обмеження швидкості наростання навантаження?
У Швидкому режимі діють обмеження швидкості наростання навантаження, щоб забезпечувати стабільно високу продуктивність для всіх клієнтів і водночас зберігати гнучку оплату за фактичне використання. Якщо одночасно (а) продуктивність Швидкого режиму знижується ТА (б) трафік клієнта зростає надто швидко, у рідкісних випадках деякі запити можуть переводитися на стандартну обробку.
Поточне обмеження швидкості наростання навантаження для Швидкого режиму наведено тут, в основній документації.
Як не перевищувати обмеження швидкості наростання навантаження
Під час зміни моделей збільшуйте трафік поступово. Наприклад, якщо ваш застосунок переходить із попереднього знімка моделі на новий, скористайтеся прапорцем функції, щоб перевести трафік протягом кількох годин, а не весь одразу.
Уникайте обробки великих обсягів даних і запуску асинхронних завдань у Швидкому режимі. Такі завдання можуть дуже швидко нарощувати трафік і часто не потребують підвищеної продуктивності Швидкого режиму.
Якщо ви регулярно стикаєтеся з обмеженнями швидкості наростання навантаження, розгляньте натомість придбання квоти Рівня масштабування.
Чи є обмеження швидкості наростання навантаження спільними для моїх проєктів або організацій?
Так, увесь ваш трафік враховується в межах одного обмеження швидкості наростання навантаження.
Політики
Що відбувається, якщо Швидкий режим не забезпечує цільового показника затримки?
З будь-якими запитаннями чи зауваженнями звертайтеся до свого AD. До угод про рівень обслуговування (SLA) Швидкого режиму застосовуватимуться ті самі правила, що й до SLA Рівня масштабування: якщо протягом певного періоду ми не виконаємо ці SLA для клієнтів з угодами Enterprise, їм буде запропоновано компенсаційні кредити на користування сервісом.
Чи сумісний Швидкий режим із вимогами до локалізації даних?
Так.
Чи сумісний Швидкий режим із ZDR та BAA?
Так.
Ultrafast для GPT-6 Astra
Ultrafast — це окремий рівень обслуговування для завдань, які потребують відповідей GPT-6 Astra з меншою затримкою, як-от інтерактивні застосунки та робочі процеси програмування.
Інформація про ціни, ліміти запитів і політики Швидкого режиму стосується запитів із service_tier="fast". Запити Ultrafast використовують окремий рівень service_tier="ultrafast".
Як надіслати запит Ultrafast?
Якщо ваша організація має доступ до Ultrafast, використовуйте Responses API з такими параметрами:
Модель:
gpt-6-astraРівень обслуговування:
ultrafastЗаголовок запиту:
OpenAI-Service-Tier: ultrafast
Окрім налаштування рівня обслуговування, обов’язково потрібно додати заголовок запиту.
У застосунках, які виконують виклики інструментів, режим WebSocket дає змогу повторно використовувати з’єднання між обмінами повідомленнями та зменшувати накладні витрати на підключення.
Чи можна використовувати той самий заголовок запиту для інших рівнів обслуговування?
Під час альфа-тестування Ultrafast заголовок OpenAI-Service-Tier приймає лише значення ultrafast. Надсилання іншого значення, зокрема default, fast або flex, призводить до повернення помилки HTTP 400. Не додавайте цей заголовок, коли використовуєте інший рівень.
Чи можна використовувати Ultrafast у режимі «Робота» або в Codex?
Ultrafast також доступний у режимі «Робота» та в Codex для планів і робочих просторів, що відповідають умовам. Умови доступності й використання в планах ChatGPT відрізняються від умов доступу через API.
Докладніше про доступність і використання читайте в статті ChatGPT Робота та Codex.
