OpenAI
Questa pagina è stata tradotta automaticamente. Visualizza l'articolo originale in inglese.

Domande frequenti sulla Modalità rapida

Domande frequenti sulla Modalità rapida e sul livello di servizio Ultrafast.

Aggiornato: 3 days ago

Offriamo la Modalità rapida ai clienti API che desiderano prestazioni più veloci e uniformi su determinati modelli. Di seguito trovi le risposte alle domande più comuni su funzionamento, prezzi, disponibilità dei modelli, limiti di richieste, affidabilità, informative e requisiti di idoneità.

Nota: il 30 luglio 2026, l'elaborazione prioritaria è stata rinominata Modalità rapida. Nelle richieste API puoi usare sia service_tier: priority sia service_tier: fast. 

Scopri di più qui.

La Modalità rapida è disponibile in tutte le aree geografiche?

La disponibilità della Modalità rapida dipende dalle leggi e dai regolamenti vigenti in ciascuna giurisdizione. Per domande sulla disponibilità nella tua area geografica, contatta il tuo Account Director.

Come funziona

I clienti possono indirizzare il traffico alla Modalità rapida per ogni singola richiesta usando il parametro esistente service_tier, con l’opzione service_tier = "fast".

I token elaborati dalla Modalità rapida saranno fatturati per singolo token, a una tariffa superiore rispetto a quella dell’elaborazione standard.

Oltre a configurarla per singola richiesta, puoi impostare la Modalità rapida come predefinita per un progetto in Impostazioni del progetto > Livello di servizio predefinito: Rapido. Puoi comunque modificare questa impostazione per ogni singola richiesta. Selezionare Rapido nelle impostazioni del progetto equivale a selezionare Prioritario.

Come interagisce con Scale Tier?

Scale Tier rimarrà separato dalla Modalità rapida. Le richieste inviate alla Modalità rapida saranno fatturate separatamente e non consumeranno i pacchetti TPM Scale Tier acquistati.

Posso inviare automaticamente alla Modalità rapida il traffico che supera la mia quota Scale Tier?

No. Il traffico inviato a Scale Tier che supera la quota non passerà automaticamente alla Modalità rapida.

Come viene fatturata la Modalità rapida?

I token elaborati dalla Modalità rapida saranno fatturati per singolo token, a una tariffa superiore rispetto a quella dell’elaborazione standard.

Il mio impegno di spesa annuale è legato a una specifica modalità di elaborazione?

No. Tutte le modalità di elaborazione concorrono al raggiungimento del tuo impegno di spesa annuale Enterprise.

Continuo a ricevere uno sconto sui token di input nella cache?

Sì! Agli input nella cache si applica lo stesso sconto del 50-75% previsto per l’elaborazione standard.

Come visualizzo l’utilizzo e la spesa della Modalità rapida?

Per visualizzare i token elaborati dalla Modalità rapida (in precedenza chiamata elaborazione prioritaria), vai alla dashboard Utilizzo, seleziona Chat Completions o Responses e scegli Raggruppa per livello di servizio.

Per visualizzare il costo della Modalità rapida, vai alla dashboard Utilizzo e seleziona Raggruppa per voce di spesa.

Nella dashboard Utilizzo, le richieste che usano priority o fast come valore di service_tier continueranno a comparire come priority. Questa visualizzazione sarà aggiornata per i modelli futuri.

Modelli

La Modalità rapida è disponibile per contesti lunghi, modelli con fine-tuning, embedding e così via?

Non al momento. In futuro valuteremo se offrire la Modalità rapida su altri prodotti, oltre ai nostri modelli più recenti.

Come funzionano le altre modalità di input e output con la Modalità rapida?

La Modalità rapida supporta le stesse funzionalità multimodali disponibili con l’elaborazione standard. In particolare, le immagini possono essere usate come input per l’elaborazione prioritaria e vengono elaborate con la stessa bassa latenza.

I modelli futuri saranno supportati?

Prevediamo di offrire la Modalità rapida sui nuovi modelli GPT, ma non garantiamo il supporto per tutti i modelli.

Limiti di richieste

Quali sono i limiti di richieste?

Ai fini dei limiti di richieste, l’utilizzo dell’elaborazione prioritaria viene trattato come il traffico API standard.

Quali sono i limiti al tasso di crescita del traffico?

La Modalità rapida prevede limiti al tasso di crescita del traffico per garantire prestazioni sempre elevate a tutti i clienti, mantenendo al contempo prezzi flessibili e on demand. Se (a) le prestazioni della Modalità rapida peggiorano E (b) il traffico di un cliente cresce troppo rapidamente, in rari casi alcune richieste potrebbero essere declassate all’elaborazione standard.

Il limite attuale al tasso di crescita del traffico della Modalità rapida è definito qui, nella nostra documentazione principale.

Consigli per rispettare il limite al tasso di crescita del traffico

Aumenta gradualmente il traffico quando cambi modello. Ad esempio, se la tua applicazione sta passando da uno snapshot precedente a uno nuovo, usa un feature flag per trasferire il traffico nell’arco di qualche ora anziché tutto in una volta.

Evita di usare la Modalità rapida per elaborare grandi quantità di dati o eseguire processi asincroni. Questi processi possono far crescere il traffico molto rapidamente e spesso non richiedono le prestazioni superiori della Modalità rapida.

Se raggiungi spesso i limiti al tasso di crescita del traffico, valuta invece l’acquisto di una quota Scale Tier.

I limiti al tasso di crescita del traffico sono condivisi tra i miei progetti o le mie organizzazioni?

Sì, tutto il tuo traffico concorre al raggiungimento dello stesso limite al tasso di crescita del traffico.

Politiche

Cosa succede se la Modalità rapida non rispetta la latenza prevista?

Per qualsiasi domanda o dubbio, contatta il tuo AD. Gli SLA della Modalità rapida saranno trattati come quelli di Scale Tier: se non riusciremo a rispettarli in un determinato intervallo di tempo, ai clienti con contratti Enterprise saranno offerti crediti di servizio.

La Modalità rapida è compatibile con la residenza dei dati?

Sì.

La Modalità rapida è compatibile con ZDR e il BAA?

Sì.

Ultrafast per GPT-6 Astra

Ultrafast è un livello di servizio separato per i carichi di lavoro che richiedono risposte di GPT-6 Astra a latenza ridotta, come le applicazioni interattive e i flussi di lavoro di programmazione.

Le indicazioni su prezzi, limiti di richieste e politiche della Modalità rapida si applicano alle richieste che usano service_tier="fast". Le richieste Ultrafast usano il livello separato service_tier="ultrafast".

Come invio una richiesta Ultrafast?

Per un’organizzazione con accesso a Ultrafast, usa l’API Responses con:

  • Modello: gpt-6-astra

  • Livello di servizio: ultrafast

  • Intestazione della richiesta: OpenAI-Service-Tier: ultrafast

Oltre all’impostazione del livello di servizio, è obbligatoria l’intestazione della richiesta.

Per le applicazioni che eseguono chiamate agli strumenti, la modalità WebSocket consente di riutilizzare una connessione tra un turno e l’altro e ridurre l’overhead di connessione.

Posso usare la stessa intestazione della richiesta per altri livelli di servizio?

Durante la fase alpha di Ultrafast, l’intestazione OpenAI-Service-Tier accetta solo ultrafast. L’invio di un altro valore, inclusi default, fast o flex, restituisce un errore HTTP 400. Ometti questa intestazione quando usi un altro livello di servizio.

Posso usare Ultrafast in Work o Codex?

Ultrafast è disponibile anche in Work e Codex per i piani e le aree di lavoro idonei. I requisiti di accesso e le condizioni di utilizzo dei piani ChatGPT sono diversi da quelli dell’API.

Consulta ChatGPT Work e Codex per i dettagli su disponibilità e utilizzo.

Questo articolo è stato utile?