Disponibilizamos o modo Fast aos clientes da API que pretendem um desempenho mais rápido e consistente em determinados modelos. Abaixo, encontrará respostas a perguntas frequentes sobre o funcionamento, os preços, a disponibilidade dos modelos, os limites de taxa, a fiabilidade, as políticas e a elegibilidade.
Nota: o processamento prioritário passou a chamar-se modo Fast em 30 de julho de 2026. Pode utilizar service_tier: priority ou service_tier: fast nos seus pedidos à API.
Saiba mais aqui.
O modo Fast está disponível em todas as regiões?
A disponibilidade do modo Fast depende das leis e dos regulamentos aplicáveis em cada jurisdição. Se tiver dúvidas sobre a disponibilidade na sua região, contacte o seu diretor de conta.
Como funciona
Os clientes podem encaminhar tráfego para o modo Fast em cada pedido através do parâmetro service_tier existente, com a opção service_tier = "fast".
Os tokens processados pelo modo Fast serão faturados por token, a um preço superior às tarifas de processamento Standard.
Além da configuração ao nível do pedido, também pode predefinir o modo Fast para um projeto em Definições do projeto > Camada de serviço predefinida: Fast. Pode continuar a substituir esta definição em cada pedido. Selecionar Fast nas definições do projeto equivale a selecionar Priority.
Como interage com a Camada de escala?
A Camada de escala continuará separada do modo Fast. Os pedidos enviados para o modo Fast serão faturados separadamente e não serão contabilizados nos pacotes de TPM da Camada de escala que adquiriu.
Posso enviar automaticamente para o modo Fast o tráfego excedente da minha Camada de escala?
Não. O tráfego enviado para a Camada de escala não será transferido automaticamente para o modo Fast.
Como é faturado o modo Fast?
Os tokens processados pelo modo Fast serão faturados por token, a um preço superior às tarifas de processamento Standard.
O meu compromisso anual está associado a um modo de processamento específico?
Não. Todos os modos de processamento são contabilizados para o seu compromisso anual de despesas Enterprise.
Continuo a beneficiar de um desconto nos tokens de entrada em cache?
Sim! As entradas em cache recebem o mesmo desconto de 50–75% aplicado no processamento Standard.
Como posso consultar a utilização e as despesas do modo Fast?
Para consultar os tokens processados pelo modo Fast (anteriormente denominado processamento prioritário), aceda ao painel Utilização, selecione Chat Completions ou Responses e escolha Agrupar por Camada de serviço.
Para consultar o custo do modo Fast, aceda ao painel Utilização e selecione Agrupar por rubrica.
No painel Utilização, os pedidos que utilizem priority ou fast como service_tier continuarão a aparecer como priority. Isto será atualizado para modelos futuros.
Modelos
O modo Fast está disponível para contexto longo, modelos com ajuste fino, embeddings, etc.?
Neste momento, não. No futuro, iremos avaliar a possibilidade de disponibilizar o modo Fast noutros produtos além dos nossos modelos mais recentes.
Como funcionam as outras modalidades com o modo Fast?
O modo Fast suporta as mesmas capacidades multimodais disponíveis no processamento Standard. Em particular, as imagens podem ser utilizadas como entradas no processamento prioritário e são processadas com a mesma baixa latência.
Os modelos futuros serão suportados?
Planeamos disponibilizar o modo Fast nos novos modelos GPT, mas não garantimos que todos os modelos sejam suportados.
Limites de taxa
Quais são os limites de taxa?
Para efeitos dos limites de taxa, o consumo do processamento prioritário é tratado da mesma forma que o tráfego Standard da API.
Quais são os limites da taxa de aumento?
O modo Fast tem limites da taxa de aumento para garantir um desempenho elevado e consistente a todos os clientes, mantendo preços flexíveis e mediante utilização. Se (a) o desempenho do modo Fast estiver degradado E (b) o tráfego de um cliente estiver a aumentar demasiado depressa, em casos raros, alguns pedidos poderão ser transferidos para o processamento Standard.
O atual limite da taxa de aumento do modo Fast está definido aqui, na nossa documentação principal.
Boas práticas para não ultrapassar o limite da taxa de aumento
Aumente gradualmente o tráfego ao mudar de modelo. Por exemplo, se a sua aplicação estiver a transitar de uma captura anterior para uma nova, utilize um sinalizador de funcionalidade para transferir o tráfego ao longo de algumas horas, em vez de o fazer de uma só vez.
Evite executar grandes tarefas de processamento de dados ou tarefas assíncronas no modo Fast. Estas tarefas podem aumentar o tráfego muito rapidamente e, muitas vezes, não necessitam do desempenho superior do modo Fast.
Se atingir frequentemente os limites da taxa de aumento, considere adquirir uma quota da Camada de escala.
Os limites da taxa de aumento são partilhados entre os meus projetos ou organizações?
Sim, todo o seu tráfego contribui para o mesmo limite da taxa de aumento.
Políticas
O que acontece se o modo Fast não cumprir o objetivo de latência?
Contacte o seu AD se tiver dúvidas ou preocupações. Os SLA do modo Fast serão tratados da mesma forma que os SLA da Camada de escala. Se não cumprirmos esses SLA num determinado período, os clientes com contratos Enterprise receberão créditos de serviço.
O modo Fast é compatível com a residência de dados?
Sim.
O modo Fast é compatível com ZDR e o BAA?
Sim.
