Offriamo la Modalità rapida ai clienti API che desiderano prestazioni più veloci e uniformi su determinati modelli. Di seguito trovi le risposte alle domande più comuni su funzionamento, prezzi, disponibilità dei modelli, limiti di richieste, affidabilità, informative e requisiti di idoneità.
Nota: il 30 luglio 2026, l'elaborazione prioritaria è stata rinominata Modalità rapida. Nelle richieste API puoi usare sia service_tier: priority sia service_tier: fast.
Scopri di più qui.
La Modalità rapida è disponibile in tutte le aree geografiche?
La disponibilità della Modalità rapida dipende dalle leggi e dai regolamenti vigenti in ciascuna giurisdizione. Per domande sulla disponibilità nella tua area geografica, contatta il tuo Account Director.
Come funziona
I clienti possono indirizzare il traffico alla Modalità rapida per ogni singola richiesta usando il parametro service_tier esistente con l'opzione service_tier = "fast".
I token elaborati in Modalità rapida vengono fatturati singolarmente, con una tariffa maggiorata rispetto a quella dell'elaborazione standard.
Oltre a configurarla a livello di richiesta, puoi impostare la Modalità rapida come predefinita per un progetto in Impostazioni progetto > Livello di servizio predefinito: Rapido. Puoi comunque sostituire l'impostazione per ogni singola richiesta. Selezionare Rapido nelle impostazioni del progetto equivale a selezionare Priorità.
Come interagisce con Scale Tier?
Scale Tier rimarrà separato dalla Modalità rapida. Le richieste inviate alla Modalità rapida saranno fatturate separatamente e non verranno detratte dai pacchetti TPM Scale Tier acquistati.
Posso inviare automaticamente alla Modalità rapida il traffico Scale Tier in eccesso?
No. Il traffico inviato a Scale Tier non passerà automaticamente alla Modalità rapida.
Come viene fatturata la Modalità rapida?
I token elaborati in Modalità rapida vengono fatturati singolarmente, con una tariffa maggiorata rispetto a quella dell'elaborazione standard.
Il mio impegno annuale è legato a una specifica modalità di elaborazione?
No. Tutte le modalità di elaborazione concorrono al raggiungimento dell'impegno di spesa annuale Enterprise.
Continuo a usufruire di uno sconto sui token di input memorizzati nella cache?
Sì! Gli input memorizzati nella cache usufruiscono dello stesso sconto del 50-75% previsto per l'elaborazione standard.
Come posso visualizzare l'utilizzo e la spesa della Modalità rapida?
Per visualizzare i token elaborati dalla Modalità rapida (in precedenza elaborazione prioritaria), apri la dashboard Utilizzo, seleziona Chat Completions o Responses e scegli Raggruppa per Livello di servizio.
Per visualizzare il costo della Modalità rapida, apri la dashboard Utilizzo e seleziona Raggruppa per voce di costo.
Nella dashboard Utilizzo, le richieste con priority o fast come service_tier continueranno a essere visualizzate come priority. Questa indicazione verrà aggiornata per i modelli futuri.
Modelli
La Modalità rapida è disponibile per contesti lunghi, modelli ottimizzati, embedding e così via?
Al momento no. In futuro valuteremo se offrire la Modalità rapida per altri prodotti oltre ai nostri modelli più recenti.
Come funzionano le altre modalità con la Modalità rapida?
La Modalità rapida supporta le stesse funzionalità multimodali disponibili con l'elaborazione standard. In particolare, le immagini possono essere usate come input per l'elaborazione prioritaria e vengono elaborate con la stessa bassa latenza.
I modelli futuri saranno supportati?
Prevediamo di offrire la Modalità rapida sui nuovi modelli GPT, ma non garantiamo che ogni modello sarà supportato.
Limiti di richieste
Quali sono i limiti di richieste?
Ai fini dei limiti di richieste, il consumo dell'elaborazione prioritaria viene trattato come il traffico API standard.
Quali sono i limiti alla velocità di aumento del traffico?
La Modalità rapida prevede limiti alla velocità di aumento del traffico per garantire prestazioni elevate e costanti a tutti i clienti, offrendo comunque prezzi flessibili e on demand. In rari casi, se (a) le prestazioni della Modalità rapida peggiorano E (b) il traffico di un cliente aumenta troppo velocemente, alcune richieste potrebbero essere trasferite all'elaborazione standard.
L'attuale limite alla velocità di aumento del traffico della Modalità rapida è definito qui, nella nostra documentazione principale.
Best practice per rispettare il limite alla velocità di aumento del traffico
Quando cambi modello, aumenta il traffico gradualmente. Ad esempio, se la tua applicazione sta passando da uno snapshot precedente a uno nuovo, usa un flag di funzionalità per trasferire il traffico nell'arco di alcune ore anziché tutto in una volta.
Evita di eseguire in Modalità rapida processi di elaborazione di grandi quantità di dati o attività asincrone. Queste attività possono far aumentare il traffico molto rapidamente e spesso non richiedono le prestazioni superiori della Modalità rapida.
Se raggiungi regolarmente i limiti alla velocità di aumento del traffico, valuta invece l'acquisto di una quota Scale Tier.
I limiti alla velocità di aumento del traffico sono condivisi tra i miei progetti o le mie organizzazioni?
Sì, tutto il tuo traffico contribuisce allo stesso limite alla velocità di aumento.
Norme
Cosa succede se la Modalità rapida non raggiunge l'obiettivo di latenza?
Per qualsiasi domanda o dubbio, contatta il tuo AD. Gli SLA della Modalità rapida saranno trattati come quelli di Scale Tier; se in un determinato intervallo di tempo non rispetteremo tali SLA per i clienti con contratti Enterprise, offriremo crediti di servizio.
La Modalità rapida è compatibile con la residenza dei dati?
Sì.
La Modalità rapida è compatibile con ZDR e BAA?
Sì.
