Oferim modul rapid clienților API care doresc performanțe mai rapide și mai constante pe anumite modele. Mai jos găsiți răspunsuri la întrebări frecvente despre modul de funcționare, prețuri, disponibilitatea modelelor, limitele de rată, fiabilitate, politici și eligibilitate.
Notă: Procesarea prioritară a fost redenumită mod rapid pe 30 iulie 2026. În solicitările API puteți folosi fie service_tier: priority, fie service_tier: fast.
Aflați mai multe aici.
Modul rapid este disponibil în toate regiunile?
Disponibilitatea modului rapid depinde de legile și reglementările aplicabile în fiecare jurisdicție. Dacă aveți întrebări despre disponibilitatea în regiunea dvs., contactați directorul de cont.
Cum funcționează
Clienții pot direcționa traficul către modul rapid pentru fiecare solicitare, folosind parametrul service_tier existent cu opțiunea service_tier = "fast".
Tokenurile procesate în modul rapid vor fi facturate per token, la un preț mai mare decât tarifele procesării Standard.
Pe lângă configurarea la nivel de solicitare, puteți seta și modul rapid ca implicit pentru un proiect, din Setările proiectului > Nivel serviciu implicit: Fast. Puteți în continuare să înlocuiți această setare pentru fiecare solicitare. Selectarea opțiunii Fast în setările proiectului este echivalentă cu selectarea opțiunii Priority.
Cum interacționează aceasta cu Nivelul de scalare?
Nivelul de scalare va rămâne separat de modul rapid. Solicitările trimise către modul rapid vor fi facturate separat și nu vor fi deduse din pachetele TPM achiziționate pentru Nivelul de scalare.
Pot trimite automat către modul rapid traficul care depășește capacitatea Nivelului de scalare?
Nu. Traficul trimis către Nivelul de scalare nu va fi redirecționat automat către modul rapid atunci când capacitatea este depășită.
Cum este facturat modul rapid?
Tokenurile procesate în modul rapid vor fi facturate per token, la un preț mai mare decât tarifele procesării Standard.
Angajamentul meu anual este asociat unui anumit mod de procesare?
Nu. Toate modurile de procesare sunt luate în calcul pentru angajamentul anual de cheltuieli Enterprise.
Primesc în continuare o reducere pentru tokenurile de intrare memorate în cache?
Da! Intrările memorate în cache beneficiază de aceeași reducere de 50–75% ca în procesarea Standard.
Cum pot vedea utilizarea și cheltuielile pentru modul rapid?
Pentru a vedea tokenurile procesate în modul rapid (cunoscut anterior ca procesare prioritară), accesați tabloul de bord Utilizare, selectați Chat Completions sau Responses, apoi Grupare după Nivel serviciu.
Pentru a vedea costul modului rapid, accesați tabloul de bord Utilizare și selectați Grupare după element de facturare.
În tabloul de bord Utilizare, solicitările care folosesc priority sau fast ca valoare pentru service_tier vor continua să apară ca priority. Acest lucru va fi actualizat pentru modelele viitoare.
Modele
Modul rapid este disponibil pentru contexte lungi, modele ajustate fin, înglobări etc.?
Nu în acest moment. Vom evalua pe viitor posibilitatea de a oferi modul rapid pentru produse suplimentare, nu doar pentru cele mai recente modele ale noastre.
Cum funcționează celelalte modalități cu modul rapid?
Modul rapid acceptă aceleași capacități multimodale disponibile în procesarea Standard. În special, imaginile pot fi folosite ca date de intrare pentru procesarea prioritară și sunt procesate cu aceeași latență redusă.
Vor fi acceptate modelele viitoare?
Intenționăm să oferim modul rapid pentru noile modele GPT, dar nu garantăm că fiecare model va fi acceptat.
Limite de rată
Care sunt limitele de rată?
În ceea ce privește limitele de rată, consumul procesării prioritare este tratat la fel ca traficul API standard.
Care sunt limitele ritmului de creștere?
Modul rapid are limite privind ritmul de creștere a traficului, pentru a asigura performanțe constant ridicate tuturor clienților, oferind în același timp prețuri flexibile, la cerere. Dacă (a) performanța modului rapid este degradată ȘI (b) traficul unui client crește prea repede, în cazuri rare, unele solicitări pot fi trecute la procesarea Standard.
Limita actuală a ritmului de creștere pentru modul rapid este definită aici, în documentația noastră principală.
Bune practici pentru respectarea limitei ritmului de creștere
Creșteți treptat traficul atunci când schimbați modelele. De exemplu, dacă aplicația trece de la un instantaneu anterior la unul nou, folosiți un indicator de funcționalitate pentru a transfera traficul pe parcursul câtorva ore, nu dintr-odată.
Evitați să rulați în modul rapid operațiuni ample de procesare a datelor sau activități asincrone. Aceste activități pot crește foarte rapid traficul și adesea nu au nevoie de performanțele îmbunătățite ale modului rapid.
Dacă atingeți frecvent limitele ritmului de creștere, luați în considerare achiziționarea unei cote pentru Nivelul de scalare.
Limitele ritmului de creștere sunt comune tuturor proiectelor sau organizațiilor mele?
Da, tot traficul dvs. contribuie la aceeași limită a ritmului de creștere.
Politici
Ce se întâmplă dacă modul rapid nu îndeplinește obiectivul de latență?
Dacă aveți întrebări sau nelămuriri, contactați directorul de cont. Acordurile SLA pentru modul rapid vor fi tratate la fel ca cele pentru Nivelul de scalare; dacă nu respectăm aceste acorduri într-un anumit interval, clienții cu acorduri Enterprise vor primi compensații pentru servicii.
Modul rapid este compatibil cu rezidența datelor?
Da.
Modul rapid este compatibil cu ZDR și BAA?
Da.
