OpenAI
Эта страница была переведена машинным переводом. Открыть оригинальную статью на английском.

Вопросы и ответы о Быстром режиме

Часто задаваемые вопросы о Быстром режиме и тарифном плане Ultrafast.

Обновлено: 5 days ago

Мы предлагаем Быстрый режим клиентам API, которым нужна более высокая и стабильная производительность некоторых моделей. Ниже приведены ответы на часто задаваемые вопросы о принципах работы, ценах, доступности моделей, лимитах запросов, надежности, правилах и условиях предоставления доступа.

Примечание. 30 июля 2026 года «Приоритетная обработка» была переименована в Быстрый режим. В запросах к API можно использовать как service_tier: priority, так и service_tier: fast. 

Подробнее читайте здесь.

Доступен ли Быстрый режим во всех регионах?

Доступность Быстрого режима зависит от законов и нормативных требований, действующих в каждой юрисдикции. Если у вас есть вопросы о доступности в вашем регионе, обратитесь к своему менеджеру по работе с клиентами.

Как это работает

Клиенты могут направлять отдельные запросы в Быстрый режим с помощью существующего параметра service_tier, задав service_tier = "fast".

В Быстром режиме оплата взимается за каждый обработанный токен по цене выше, чем при стандартной обработке.

Помимо настройки для отдельных запросов, Быстрый режим можно включить по умолчанию для проекта: Настройки проекта > Тарифный план по умолчанию: Быстрый. При этом для отдельных запросов по-прежнему можно выбрать другой режим. Выбор варианта «Быстрый» в настройках проекта равнозначен выбору варианта «Приоритетный».

Как Быстрый режим сочетается с «Уровнем производительности»?

«Уровень производительности» останется отдельным от Быстрого режима предложением. Запросы, направленные в Быстрый режим, оплачиваются отдельно и не расходуют приобретенные пакеты токенов в минуту (TPM) «Уровня производительности».

Можно ли автоматически направлять в Быстрый режим трафик, превышающий квоту «Уровня производительности»?

Нет. Трафик, направленный на «Уровень производительности», не будет автоматически перенаправляться в Быстрый режим при превышении квоты.

Как оплачивается Быстрый режим?

В Быстром режиме оплата взимается за каждый обработанный токен по цене выше, чем при стандартной обработке.

Привязаны ли мои годовые обязательства по расходам к определенному режиму обработки?

Нет. Расходы на все режимы обработки засчитываются в счет ваших годовых обязательств по расходам в рамках Enterprise.

Сохраняется ли скидка на кэшированные входные токены?

Да! На кэшированные входные данные действует та же скидка 50–75%, что и при стандартной обработке.

Как посмотреть использование Быстрого режима и расходы на него?

Чтобы посмотреть количество токенов, обработанных в Быстром режиме (ранее — приоритетная обработка), откройте панель использования, выберите Chat Completions или Responses и задайте группировку по тарифному плану.

Чтобы посмотреть расходы на Быстрый режим, откройте панель использования и выберите группировку по статье расходов.

На панели использования запросы со значением priority или fast в параметре service_tier по-прежнему будут отображаться как priority. Для будущих моделей это отображение будет обновлено.

Модели

Доступен ли Быстрый режим для длинного контекста, дообученных моделей, эмбеддингов и т. д.?

Пока нет. В будущем мы рассмотрим возможность добавить Быстрый режим в другие продукты, помимо наших новейших моделей.

Как Быстрый режим работает с другими модальностями?

Быстрый режим поддерживает те же мультимодальные возможности, что и стандартная обработка. В частности, в приоритетную обработку можно передавать изображения: они обрабатываются с такой же низкой задержкой.

Будут ли поддерживаться будущие модели?

Мы планируем предлагать Быстрый режим для новых моделей GPT, но не гарантируем поддержку каждой модели.

Лимиты запросов

Какие действуют лимиты запросов?

При расчете лимитов запросов приоритетная обработка учитывается так же, как стандартный трафик API.

Какие действуют ограничения скорости нарастания нагрузки?

В Быстром режиме действуют ограничения скорости нарастания нагрузки, чтобы обеспечить стабильно высокую производительность для всех клиентов, сохранив гибкую оплату по мере использования. Если одновременно (а) производительность Быстрого режима снижается И (б) трафик клиента растет слишком быстро, в редких случаях некоторые запросы могут быть переведены на стандартную обработку.

Текущее ограничение скорости нарастания нагрузки в Быстром режиме указано здесь, в нашей основной документации.

Как не превышать ограничение скорости нарастания нагрузки

При смене модели увеличивайте трафик постепенно. Например, если ваше приложение переходит с предыдущего снимка модели на новый, используйте флаг функции, чтобы переводить трафик в течение нескольких часов, а не весь сразу.

Не используйте Быстрый режим для обработки больших объемов данных или асинхронных задач. Такие задачи могут вызвать очень быстрый рост трафика, при этом повышенная производительность Быстрого режима им часто не нужна.

Если вы регулярно сталкиваетесь с ограничениями скорости нарастания нагрузки, рассмотрите возможность покупки квоты «Уровня производительности».

Действует ли общее ограничение скорости нарастания нагрузки для всех моих проектов и организаций?

Да, весь ваш трафик учитывается в рамках одного ограничения скорости нарастания нагрузки.

Правила

Что происходит, если Быстрый режим не обеспечивает целевую задержку?

По любым вопросам или проблемам обращайтесь к своему менеджеру по работе с клиентами (AD). К SLA Быстрого режима применяются те же условия, что и к SLA «Уровня производительности»: если за установленный период мы не выполним SLA для клиентов с соглашениями Enterprise, им будут предоставлены кредиты на использование сервиса.

Совместим ли Быстрый режим с резидентностью данных?

Да.

Совместим ли Быстрый режим с ZDR и BAA?

Да.

Ultrafast для GPT-6 Astra

Ultrafast — отдельный тарифный план для задач, требующих ответов GPT-6 Astra с меньшей задержкой, например для интерактивных приложений и разработки кода.

Цены, лимиты запросов и правила Быстрого режима распространяются на запросы с параметром service_tier="fast". Для запросов Ultrafast используется отдельный тарифный план service_tier="ultrafast".

Как отправить запрос Ultrafast?

Если у организации есть доступ к Ultrafast, используйте Responses API со следующими параметрами:

  • Модель: gpt-6-astra

  • Тарифный план: ultrafast

  • Заголовок запроса: OpenAI-Service-Tier: ultrafast

Помимо настройки тарифного плана, обязательно укажите заголовок запроса.

В приложениях, выполняющих вызовы инструментов, режим WebSocket позволяет повторно использовать одно соединение на разных шагах диалога и сократить накладные расходы на подключение.

Можно ли использовать тот же заголовок запроса для других тарифных планов?

На этапе альфа-тестирования Ultrafast заголовок OpenAI-Service-Tier принимает только значение ultrafast. При передаче другого значения, включая default, fast или flex, возвращается ошибка HTTP 400. При использовании другого тарифного плана не указывайте этот заголовок.

Можно ли использовать Ultrafast в режиме «Работа» или Codex?

Ultrafast также доступен в режиме «Работа» и Codex для поддерживаемых планов и рабочих пространств. Доступность и условия использования в планах ChatGPT отличаются от условий доступа через API.

Подробнее о доступности и использовании см. в статье ChatGPT Работа и Codex.

Была ли эта статья полезной?