OpenAI
Esta página foi traduzida automaticamente. Veja o artigo original em inglês.

Perguntas frequentes sobre o modo Fast

Perguntas frequentes sobre o modo Fast e o nível de serviço Ultrafast.

Atualizado: 4 days ago

Oferecemos o modo Fast para clientes da API que desejam um desempenho mais rápido e consistente em determinados modelos. Veja abaixo as respostas às dúvidas mais comuns sobre funcionamento, preços, disponibilidade de modelos, limites de taxa, confiabilidade, políticas e elegibilidade.

Observação: em 30 de julho de 2026, o processamento prioritário passou a se chamar modo Fast. Você pode usar service_tier: priority ou service_tier: fast nas suas solicitações à API. 

Saiba mais aqui.

O modo Fast está disponível em todas as regiões?

A disponibilidade do modo Fast depende das leis e regulamentações aplicáveis em cada jurisdição. Em caso de dúvidas sobre a disponibilidade na sua região, entre em contato com seu diretor de contas.

Como funciona

Os clientes podem direcionar o tráfego para o modo Fast por solicitação usando o parâmetro service_tier existente, com a opção service_tier = "fast".

Os tokens processados pelo modo Fast serão cobrados por token, com tarifas superiores às do processamento padrão.

Além de configurar o modo Fast por solicitação, você também pode defini-lo como padrão de um projeto em Configurações do projeto > Nível de serviço padrão: Fast. Você ainda pode substituir essa configuração em cada solicitação. Selecionar Fast nas configurações do projeto equivale a selecionar Prioridade.

Como isso funciona em relação ao Nível de escala?

O Nível de escala continuará separado do modo Fast. As solicitações enviadas ao modo Fast serão cobradas separadamente e não consumirão os pacotes de TPM que você adquiriu no Nível de escala.

Posso enviar automaticamente o tráfego excedente do Nível de escala para o modo Fast?

Não. O tráfego excedente enviado ao Nível de escala não será redirecionado automaticamente para o modo Fast.

Como o modo Fast é cobrado?

Os tokens processados pelo modo Fast serão cobrados por token, com tarifas superiores às do processamento padrão.

Meu compromisso anual está vinculado a um modo de processamento específico?

Não. Todos os modos de processamento contam para o cumprimento do seu compromisso anual de gastos Enterprise.

Continuo recebendo desconto nos tokens de entrada em cache?

Sim! As entradas em cache recebem o mesmo desconto de 50% a 75% aplicado no processamento padrão.

Como vejo meu uso e meus gastos com o modo Fast?

Para ver os tokens processados pelo modo Fast (antes chamado de processamento prioritário), acesse o painel de uso, selecione Chat Completions ou Responses e agrupe por Nível de serviço.

Para ver o custo do modo Fast, acesse o painel de uso e selecione Agrupar por item.

No painel de uso, as solicitações que usam priority ou fast como service_tier continuarão aparecendo como priority. Isso será atualizado para modelos futuros.

Modelos

O modo Fast está disponível para contextos longos, modelos com ajuste fino, embeddings etc.?

Não no momento. No futuro, avaliaremos a possibilidade de oferecer o modo Fast em outros produtos além dos nossos modelos mais recentes.

Como outras modalidades funcionam com o modo Fast?

O modo Fast oferece os mesmos recursos multimodais disponíveis no processamento padrão. Em particular, imagens podem ser usadas como entradas no processamento prioritário e são processadas com a mesma baixa latência.

Haverá suporte a modelos futuros?

Planejamos oferecer o modo Fast em novos modelos GPT, mas não garantimos que todos os modelos terão suporte.

Limites de taxa

Quais são os limites de taxa?

Para fins de limites de taxa, o consumo do processamento prioritário é tratado da mesma forma que o tráfego padrão da API.

Quais são os limites da taxa de crescimento?

O modo Fast tem limites da taxa de crescimento para garantir um desempenho elevado e consistente para todos os clientes, sem deixar de oferecer preços flexíveis e sob demanda. Se (a) o desempenho do modo Fast estiver degradado E (b) o tráfego de um cliente estiver aumentando rápido demais, algumas solicitações poderão ser rebaixadas para o processamento padrão em casos raros.

O limite atual da taxa de crescimento do modo Fast está definido em nossa documentação principal aqui.

Boas práticas para não ultrapassar seu limite da taxa de crescimento

Aumente o tráfego gradualmente ao trocar de modelo. Por exemplo, se sua aplicação estiver migrando de um snapshot anterior para um novo, use uma flag de recurso para migrar o tráfego ao longo de algumas horas, em vez de fazer isso de uma só vez.

Evite executar tarefas de processamento de grandes volumes de dados ou tarefas assíncronas no modo Fast. Essas tarefas podem aumentar o tráfego muito rapidamente e, muitas vezes, não precisam do desempenho superior do modo Fast.

Se você atinge os limites da taxa de crescimento com frequência, considere adquirir uma cota do Nível de escala como alternativa.

Os limites da taxa de crescimento são compartilhados entre meus projetos ou organizações?

Sim, todo o seu tráfego é contabilizado para o mesmo limite da taxa de crescimento.

Políticas

O que acontece se o modo Fast não atingir a meta de latência?

Entre em contato com seu AD se tiver dúvidas ou preocupações. Os SLAs do modo Fast serão tratados da mesma forma que os SLAs do Nível de escala; ofereceremos créditos de serviço caso não cumpramos esses SLAs para clientes com contratos Enterprise em um determinado período.

O modo Fast é compatível com a residência de dados?

Sim.

O modo Fast é compatível com ZDR e com o BAA?

Sim.

Ultrafast para GPT-6 Astra

O Ultrafast é um nível de serviço separado para cargas de trabalho que precisam de respostas do GPT-6 Astra com menor latência, como aplicações interativas e fluxos de trabalho de programação.

As orientações de preços, limites de taxa e políticas do modo Fast se aplicam às solicitações que usam service_tier="fast". As solicitações Ultrafast usam o nível separado service_tier="ultrafast".

Como envio uma solicitação Ultrafast?

Para uma organização com acesso ao Ultrafast, use a API Responses com:

  • Modelo: gpt-6-astra

  • Nível de serviço: ultrafast

  • Cabeçalho da solicitação: OpenAI-Service-Tier: ultrafast

O cabeçalho da solicitação é obrigatório, além da configuração do nível de serviço.

Para aplicações que executam chamadas de ferramentas, o modo WebSocket permite reutilizar uma conexão entre turnos e reduzir a sobrecarga de conexão.

Posso usar o mesmo cabeçalho de solicitação para outros níveis de serviço?

Durante a fase alfa do Ultrafast, o cabeçalho OpenAI-Service-Tier aceita apenas ultrafast. O envio de outro valor, incluindo default, fast ou flex, retorna um erro HTTP 400. Omita esse cabeçalho ao usar outro nível.

Posso usar o Ultrafast no Work ou no Codex?

O Ultrafast também está disponível no Work e no Codex para planos e espaços de trabalho elegíveis. As condições de elegibilidade e uso nos planos do ChatGPT diferem das condições de acesso pela API.

Consulte ChatGPT Work e Codex para saber mais sobre disponibilidade e uso.

Este artigo foi útil?