OpenAI
Această pagină a fost tradusă automat. Vezi articolul original în limba engleză.

Întrebări frecvente despre modul rapid

Întrebări frecvente despre modul rapid și nivelul de serviciu Ultrafast.

Actualizat: 2 days ago

Oferim modul rapid clienților API care doresc performanțe mai rapide și mai constante pentru anumite modele. Mai jos găsiți răspunsuri la întrebări frecvente despre modul de funcționare, prețuri, disponibilitatea modelelor, limitele de rată, fiabilitate, politici și eligibilitate.

Notă: Procesarea prioritară a fost redenumită „mod rapid” pe 30 iulie 2026. Puteți folosi fie service_tier: priority, fie service_tier: fast în solicitările API. 

Aflați mai multe aici.

Modul rapid este disponibil în toate regiunile?

Disponibilitatea modului rapid depinde de legile și reglementările aplicabile în fiecare jurisdicție. Dacă aveți întrebări despre disponibilitatea în regiunea dvs., contactați directorul de cont.

Cum funcționează

Clienții pot direcționa traficul către modul rapid pentru fiecare cerere în parte, folosind parametrul existent service_tier cu opțiunea service_tier = "fast".

Tokenurile procesate în modul rapid vor fi facturate per token, la un tarif mai mare decât cel al procesării standard.

Pe lângă configurarea la nivel de cerere, poți seta modul rapid ca implicit pentru un proiect din Setările proiectului > Nivel serviciu implicit: Rapid. Poți în continuare să modifici această setare pentru fiecare cerere în parte. Selectarea opțiunii Rapid în setările proiectului este echivalentă cu selectarea opțiunii Prioritar.

Cum interacționează modul rapid cu Nivelul de scalare?

Nivelul de scalare va rămâne separat de modul rapid. Cererile trimise către modul rapid vor fi facturate separat și nu vor consuma din pachetele TPM achiziționate pentru Nivelul de scalare.

Pot trimite automat către modul rapid traficul care depășește cota Nivelului de scalare?

Nu. Traficul trimis către Nivelul de scalare care depășește cota nu va fi redirecționat automat către modul rapid.

Cum este facturat modul rapid?

Tokenurile procesate în modul rapid vor fi facturate per token, la un tarif mai mare decât cel al procesării standard.

Angajamentul meu anual este legat de un anumit mod de procesare?

Nu. Toate modurile de procesare sunt luate în calcul pentru îndeplinirea angajamentului tău anual de cheltuieli Enterprise.

Beneficiez în continuare de o reducere pentru tokenurile de intrare din cache?

Da! Datele de intrare din cache beneficiază de aceeași reducere de 50–75% ca în cazul procesării standard.

Cum pot vedea utilizarea și cheltuielile aferente modului rapid?

Pentru a vedea tokenurile procesate în modul rapid (denumit anterior procesare prioritară), accesează panoul Utilizare, selectează Chat Completions sau Responses, apoi Grupează după Nivel serviciu.

Pentru a vedea costul modului rapid, accesează panoul Utilizare și selectează Grupează după element de facturare.

În panoul Utilizare, cererile care folosesc priority sau fast ca valoare pentru service_tier vor continua să apară ca priority. Acest mod de afișare va fi actualizat pentru modelele viitoare.

Modele

Modul rapid este disponibil pentru contexte lungi, modele ajustate fin, reprezentări vectoriale etc.?

Nu în acest moment. Vom evalua în viitor dacă vom oferi modul rapid și pentru alte produse, pe lângă cele mai recente modele ale noastre.

Cum funcționează celelalte modalități în modul rapid?

Modul rapid oferă aceleași capabilități multimodale ca procesarea standard. Mai exact, imaginile pot fi folosite ca date de intrare pentru procesarea prioritară și sunt procesate cu aceeași latență redusă.

Va exista suport pentru modelele viitoare?

Intenționăm să oferim modul rapid pentru noile modele GPT, dar nu garantăm că va fi disponibil pentru fiecare model.

Limite de rată

Care sunt limitele de rată?

În ceea ce privește limitele de rată, consumul aferent procesării prioritare este tratat la fel ca traficul API standard.

Care sunt limitele ritmului de creștere?

Modul rapid are limite ale ritmului de creștere pentru a asigura performanțe constant ridicate pentru toți clienții, oferind totodată tarife flexibile, în funcție de utilizare. Dacă (a) performanța modului rapid scade ȘI (b) traficul unui client crește prea repede, în cazuri rare, unele cereri pot fi redirecționate către procesarea standard.

Limita actuală a ritmului de creștere pentru modul rapid este definită aici, în documentația noastră principală.

Bune practici pentru a nu depăși limita ritmului de creștere

Mărește treptat traficul când schimbi modelele. De exemplu, dacă aplicația ta trece de la o versiune anterioară a modelului la una nouă, folosește un indicator de activare a funcționalității pentru a transfera traficul pe parcursul câtorva ore, nu tot odată.

Evită să rulezi sarcini de procesare a unor volume mari de date sau sarcini asincrone în modul rapid. Aceste sarcini pot crește traficul foarte repede și adesea nu au nevoie de performanța sporită a modului rapid.

Dacă atingi frecvent limitele ritmului de creștere, ia în considerare achiziționarea unei cote de utilizare pentru Nivelul de scalare.

Limitele ritmului de creștere sunt comune tuturor proiectelor sau organizațiilor mele?

Da, tot traficul tău este luat în calcul pentru aceeași limită a ritmului de creștere.

Politici

Ce se întâmplă dacă modul rapid nu respectă latența țintă?

Contactează responsabilul tău de cont (AD) pentru orice întrebări sau nelămuriri. Acordurile privind nivelul serviciului (SLA) pentru modul rapid vor fi tratate la fel ca cele pentru Nivelul de scalare; vom oferi credite pentru servicii dacă nu respectăm aceste SLA-uri pentru clienții cu contracte Enterprise într-un anumit interval de timp.

Modul rapid este compatibil cu rezidența datelor?

Da.

Modul rapid este compatibil cu ZDR și BAA?

Da.

Ultrafast pentru GPT-6 Astra

Ultrafast este un nivel de serviciu separat pentru sarcini care necesită răspunsuri GPT-6 Astra cu latență mai mică, precum aplicațiile interactive și fluxurile de lucru de programare.

Informațiile privind tarifele, limitele de rată și politicile modului rapid se aplică cererilor care folosesc service_tier="fast". Cererile Ultrafast folosesc nivelul separat service_tier="ultrafast".

Cum trimit o cerere Ultrafast?

Pentru o organizație cu acces la Ultrafast, folosește API-ul Responses cu:

  • Model: gpt-6-astra

  • Nivel serviciu: ultrafast

  • Antet de cerere: OpenAI-Service-Tier: ultrafast

Pe lângă setarea nivelului de serviciu, este necesar și antetul de cerere.

Pentru aplicațiile care execută apeluri de instrumente, modul WebSocket permite reutilizarea unei conexiuni de la un schimb de mesaje la altul și reducerea resurselor suplimentare necesare conectării.

Pot folosi același antet de cerere pentru alte niveluri de serviciu?

În faza alfa a Ultrafast, antetul OpenAI-Service-Tier acceptă doar ultrafast. Trimiterea unei alte valori, inclusiv default, fast sau flex, returnează o eroare HTTP 400. Omite acest antet când folosești un alt nivel.

Pot folosi Ultrafast în Work sau Codex?

Ultrafast este disponibil și în Work și Codex pentru planurile și spațiile de lucru eligibile. Condițiile de eligibilitate și de utilizare pentru planurile ChatGPT diferă de cele pentru accesul prin API.

Consultă ChatGPT Work și Codex pentru detalii despre disponibilitate și utilizare.

A fost util acest articol?