Disponibilizamos o modo Fast aos clientes da API que pretendam um desempenho mais rápido e consistente em determinados modelos. Abaixo, encontra respostas a perguntas frequentes sobre o funcionamento, os preços, a disponibilidade dos modelos, os limites de taxa, a fiabilidade, as políticas e a elegibilidade.
Nota: a 30 de julho de 2026, o processamento prioritário passou a chamar-se modo Fast. Pode utilizar service_tier: priority ou service_tier: fast nos seus pedidos à API.
Saiba mais aqui.
O modo Fast está disponível em todas as regiões?
A disponibilidade do modo Fast depende das leis e dos regulamentos aplicáveis em cada jurisdição. Se tiver dúvidas sobre a disponibilidade na sua região, contacte o seu diretor de conta.
Como funciona
Os clientes podem encaminhar tráfego para o modo Fast em cada pedido, utilizando o parâmetro existente service_tier com a opção service_tier = "fast".
Os tokens processados pelo modo Fast serão faturados por token, a um preço superior ao das tarifas de processamento padrão.
Além da configuração por pedido, também pode definir o modo Fast como predefinição de um projeto em Definições do projeto > Camada de serviço predefinida: Fast. Pode continuar a substituir esta definição em cada pedido. Selecionar Fast nas definições do projeto equivale a selecionar Prioridade.
Como se articula o modo Fast com a Camada de escala?
A Camada de escala continuará separada do modo Fast. Os pedidos enviados para o modo Fast serão faturados separadamente e não serão descontados dos pacotes de TPM adquiridos na Camada de escala.
Posso enviar automaticamente o tráfego excedente da Camada de escala para o modo Fast?
Não. O tráfego excedente enviado para a Camada de escala não será encaminhado automaticamente para o modo Fast.
Como é faturado o modo Fast?
Os tokens processados pelo modo Fast serão faturados por token, a um preço superior ao das tarifas de processamento padrão.
O meu compromisso anual está associado a um modo de processamento específico?
Não. Todos os modos de processamento contam para o seu compromisso de despesa anual Enterprise.
Continuo a ter desconto nos tokens de entrada em cache?
Sim! As entradas em cache beneficiam do mesmo desconto de 50–75% que no processamento padrão.
Como consulto a minha utilização e despesa do modo Fast?
Para consultar os tokens processados pelo modo Fast (anteriormente designado processamento prioritário), aceda ao painel de utilização, selecione Chat Completions ou Responses e escolha Agrupar por Camada de serviço.
Para consultar o custo do modo Fast, aceda ao painel de utilização e selecione Agrupar por rubrica.
No painel de utilização, os pedidos que utilizem priority ou fast como valor de service_tier continuarão a aparecer como priority. Esta apresentação será atualizada para os futuros modelos.
Modelos
O modo Fast está disponível para contextos longos, modelos com ajuste fino, embeddings, etc.?
De momento, não. No futuro, avaliaremos a possibilidade de disponibilizar o modo Fast noutros produtos, além dos nossos modelos mais recentes.
Como funcionam as outras modalidades com o modo Fast?
O modo Fast suporta as mesmas capacidades multimodais disponíveis no processamento padrão. Em particular, é possível utilizar imagens como entradas no processamento prioritário, com a mesma baixa latência.
Os futuros modelos serão suportados?
Planeamos disponibilizar o modo Fast nos novos modelos GPT, mas não garantimos que todos os modelos sejam suportados.
Limites de taxa
Quais são os limites de taxa?
Para efeitos dos limites de taxa, o consumo de processamento prioritário é tratado da mesma forma que o tráfego padrão da API.
Quais são os limites da taxa de aumento?
O modo Fast tem limites da taxa de aumento para garantir um desempenho consistentemente elevado a todos os clientes, mantendo preços flexíveis em função da utilização. Se (a) o desempenho do modo Fast estiver degradado E (b) o tráfego de um cliente estiver a aumentar demasiado depressa, alguns pedidos poderão, em casos raros, passar para o processamento padrão.
O limite atual da taxa de aumento do modo Fast está definido aqui, na nossa documentação principal.
Boas práticas para não ultrapassar o limite da taxa de aumento
Aumente o tráfego gradualmente ao mudar de modelo. Por exemplo, se a sua aplicação estiver a passar de uma versão anterior para uma nova, utilize um sinalizador de funcionalidade para transferir o tráfego ao longo de algumas horas, em vez de o fazer de uma só vez.
Evite executar tarefas de processamento de grandes volumes de dados ou tarefas assíncronas no modo Fast. Estas tarefas podem fazer aumentar o tráfego muito rapidamente e, muitas vezes, não necessitam do desempenho melhorado do modo Fast.
Se atingir frequentemente os limites da taxa de aumento, considere adquirir uma quota da Camada de escala como alternativa.
Os limites da taxa de aumento são partilhados entre os meus projetos ou organizações?
Sim, todo o seu tráfego conta para o mesmo limite da taxa de aumento.
Políticas
O que acontece se o modo Fast não cumprir o objetivo de latência?
Contacte o seu AD se tiver dúvidas ou preocupações. Os SLA do modo Fast serão tratados da mesma forma que os SLA da Camada de escala; serão concedidos créditos de serviço se não cumprirmos esses SLA para clientes com contratos Enterprise durante um determinado período.
O modo Fast é compatível com a residência de dados?
Sim.
O modo Fast é compatível com o ZDR e o BAA?
Sim.
Ultrafast para o GPT-6 Astra
O Ultrafast é uma camada de serviço separada para cargas de trabalho que exigem respostas do GPT-6 Astra com menor latência, como aplicações interativas e fluxos de trabalho de programação.
As orientações sobre preços, limites de taxa e políticas do modo Fast aplicam-se aos pedidos que utilizam service_tier="fast". Os pedidos Ultrafast utilizam a camada separada service_tier="ultrafast".
Como envio um pedido Ultrafast?
Numa organização com acesso ao Ultrafast, utilize a API Responses com:
Modelo:
gpt-6-astraCamada de serviço:
ultrafastCabeçalho do pedido:
OpenAI-Service-Tier: ultrafast
Além de definir a camada de serviço, é obrigatório incluir o cabeçalho do pedido.
Nas aplicações que executam chamadas de ferramentas, o modo WebSocket permite reutilizar uma ligação ao longo de várias interações e reduzir a sobrecarga de estabelecer ligações.
Posso utilizar o mesmo cabeçalho de pedido para outras camadas de serviço?
Durante a fase alfa do Ultrafast, o cabeçalho OpenAI-Service-Tier aceita apenas ultrafast. O envio de outro valor, incluindo default, fast ou flex, devolve um erro HTTP 400. Omita este cabeçalho ao utilizar outra camada.
Posso utilizar o Ultrafast no Work ou no Codex?
O Ultrafast também está disponível no Work e no Codex para planos e espaços de trabalho elegíveis. As condições de elegibilidade e utilização dos planos do ChatGPT diferem das do acesso à API.
Consulte ChatGPT Work e Codex para obter detalhes sobre a disponibilidade e a utilização.
