Ofrojmë modalitetin e shpejtë për klientët e API-së që kërkojnë performancë më të shpejtë dhe më të qëndrueshme në modele të caktuara. Më poshtë gjeni përgjigjet për pyetjet e zakonshme rreth mënyrës së funksionimit, çmimeve, disponueshmërisë së modeleve, kufijve të normës, besueshmërisë, politikave dhe kritereve të kualifikimit.
Shënim: Më 30 korrik 2026, përpunimi me përparësi u riemërtua modaliteti i shpejtë. Në kërkesat tuaja për API-në mund të përdorni service_tier: priority ose service_tier: fast.
Mësoni më shumë këtu.
A ofrohet modaliteti i shpejtë në të gjitha rajonet?
Disponueshmëria e modalitetit të shpejtë varet nga ligjet dhe rregulloret në fuqi në secilin juridiksion. Nëse keni pyetje rreth disponueshmërisë në rajonin tuaj, ju lutemi kontaktoni Drejtorin e Llogarisë.
Si funksionon
Klientët mund ta drejtojnë trafikun në modalitetin e shpejtë për çdo kërkesë veçmas, duke përdorur parametrin ekzistues service_tier me opsionin service_tier = "fast".
Tokenët e përpunuar nga modaliteti i shpejtë do të faturohen për token, me një çmim më të lartë se tarifat e përpunimit standard.
Përveç konfigurimit për çdo kërkesë, mund ta caktoni modalitetin e shpejtë si të parazgjedhur për një projekt te Cilësimet e projektit > Niveli i parazgjedhur i shërbimit: I shpejtë. Mund ta ndryshoni sërish këtë zgjedhje për çdo kërkesë veçmas. Zgjedhja e opsionit I shpejtë në cilësimet e projektit është e barasvlershme me zgjedhjen e opsionit Me përparësi.
Si ndërvepron ky modalitet me nivelin e shkallëzimit?
Niveli i shkallëzimit do të mbetet i ndarë nga modaliteti i shpejtë. Kërkesat e dërguara në modalitetin e shpejtë do të faturohen veçmas dhe nuk do të konsumojnë paketat TPM që keni blerë për nivelin e shkallëzimit.
A mund ta dërgoj automatikisht në modalitetin e shpejtë trafikun që tejkalon kapacitetin e nivelit të shkallëzimit?
Jo. Trafiku i dërguar në nivelin e shkallëzimit nuk do të kalojë automatikisht në modalitetin e shpejtë kur tejkalon kapacitetin.
Si faturohet modaliteti i shpejtë?
Tokenët e përpunuar nga modaliteti i shpejtë do të faturohen për token, me një çmim më të lartë se tarifat e përpunimit standard.
A lidhet angazhimi im vjetor me një modalitet të caktuar përpunimi?
Jo. Shpenzimet për të gjitha modalitetet e përpunimit llogariten për përmbushjen e angazhimit tuaj vjetor të shpenzimeve për Enterprise.
A përfitoj ende zbritje për tokenët hyrës të ruajtur në cache?
Po! Të dhënat hyrëse të ruajtura në cache përfitojnë të njëjtën zbritje prej 50-75% si në përpunimin standard.
Si t’i shoh përdorimin dhe shpenzimet e mia për modalitetin e shpejtë?
Për të parë tokenët e përpunuar nga modaliteti i shpejtë (i njohur më parë si përpunimi me përparësi), shkoni te paneli i Përdorimit, zgjidhni Chat Completions ose Responses dhe Gruponi sipas nivelit të shërbimit.
Për të parë koston e modalitetit të shpejtë, shkoni te paneli i Përdorimit dhe zgjidhni Gruponi sipas zërit të faturimit.
Në panelin e Përdorimit, kërkesat që përdorin priority ose fast si vlerë të service_tier do të vazhdojnë të shfaqen si priority. Kjo do të përditësohet për modelet e ardhshme.
Modelet
A ofrohet modaliteti i shpejtë për kontekst të gjatë, modele të përshtatura me trajnim shtesë, përfaqësime vektoriale etj.?
Jo për momentin. Në të ardhmen do të vlerësojmë nëse do ta ofrojmë modalitetin e shpejtë edhe në produkte të tjera, përtej modeleve tona më të fundit.
Si funksionojnë modalitetet e tjera të të dhënave me modalitetin e shpejtë?
Modaliteti i shpejtë mbështet të njëjtat aftësi multimodale që ofrohen në përpunimin standard. Në veçanti, imazhet mund të përdoren si të dhëna hyrëse për përpunimin me përparësi dhe përpunohen me të njëjtën vonesë të ulët.
A do të mbështeten modelet e ardhshme?
Planifikojmë ta ofrojmë modalitetin e shpejtë në modelet e reja GPT, por nuk garantojmë që çdo model do të mbështetet.
Kufijtë e normës
Cilët janë kufijtë e normës?
Për sa u përket kufijve të normës, përdorimi i përpunimit me përparësi trajtohet njësoj si trafiku standard i API-së.
Cilët janë kufijtë e shpejtësisë së rritjes së trafikut?
Modaliteti i shpejtë ka kufij të shpejtësisë së rritjes së trafikut për të siguruar performancë vazhdimisht të lartë për të gjithë klientët, duke ofruar njëkohësisht çmime fleksibël sipas përdorimit. Nëse (a) performanca e modalitetit të shpejtë bie DHE (b) trafiku i një klienti po rritet tepër shpejt, në raste të rralla disa kërkesa mund të kalohen në përpunimin standard.
Kufiri aktual i shpejtësisë së rritjes së trafikut për modalitetin e shpejtë përcaktohet këtu, në dokumentacionin tonë kryesor.
Praktikat më të mira për të mos tejkaluar kufirin e shpejtësisë së rritjes së trafikut
Rriteni trafikun gradualisht kur ndërroni modelet. Për shembull, nëse aplikacioni juaj po kalon nga një version i mëparshëm i modelit në një të ri, përdorni një parametër aktivizimi të veçorisë për ta kaluar trafikun gjatë disa orëve dhe jo të gjithin menjëherë.
Shmangni ekzekutimin e detyrave të përpunimit të sasive të mëdha të të dhënave ose të detyrave asinkrone në modalitetin e shpejtë. Këto detyra mund ta rritin trafikun shumë shpejt dhe shpesh nuk kanë nevojë për performancën më të mirë të modalitetit të shpejtë.
Nëse arrini shpesh kufijtë e shpejtësisë së rritjes së trafikut, merrni parasysh blerjen e kuotës së nivelit të shkallëzimit si alternativë.
A janë të përbashkët kufijtë e shpejtësisë së rritjes së trafikut për projektet ose organizatat e mia?
Po, i gjithë trafiku juaj llogaritet brenda të njëjtit kufi të shpejtësisë së rritjes së trafikut.
Politikat
Çfarë ndodh nëse modaliteti i shpejtë nuk e përmbush objektivin e vonesës?
Ju lutemi kontaktoni AD-në tuaj për çdo pyetje ose shqetësim. SLA-të e modalitetit të shpejtë do të trajtohen njësoj si SLA-të e nivelit të shkallëzimit; do të ofrohen kredite shërbimi nëse nuk i përmbushim këto SLA për klientët me marrëveshje Enterprise gjatë një intervali të caktuar kohor.
A është modaliteti i shpejtë i pajtueshëm me qëndrimin e të dhënave?
Po.
A është modaliteti i shpejtë i pajtueshëm me ZDR dhe BAA?
Po.
Ultrafast për GPT-6 Astra
Ultrafast është një nivel shërbimi më vete për ngarkesa pune që kërkojnë përgjigje me vonesë më të ulët nga GPT-6 Astra, si aplikacionet ndërvepruese dhe rrjedhat e punës së programimit.
Udhëzimet për çmimet, kufijtë e normës dhe politikat e modalitetit të shpejtë zbatohen për kërkesat që përdorin service_tier="fast". Kërkesat Ultrafast përdorin nivelin e veçantë service_tier="ultrafast".
Si të dërgoj një kërkesë Ultrafast?
Për një organizatë me qasje në Ultrafast, përdorni Responses API me:
Modeli:
gpt-6-astraNiveli i shërbimit:
ultrafastFusha e kreut të kërkesës:
OpenAI-Service-Tier: ultrafast
Fusha e kreut të kërkesës është e detyrueshme, krahas cilësimit të nivelit të shërbimit.
Për aplikacionet që ekzekutojnë thirrje mjetesh, modaliteti WebSocket ju lejon të ripërdorni një lidhje gjatë shkëmbimeve të njëpasnjëshme dhe të zvogëloni ngarkesën shtesë të krijimit të lidhjeve.
A mund të përdor të njëjtën fushë të kreut të kërkesës për nivele të tjera shërbimi?
Gjatë fazës alfa të Ultrafast, fusha e kreut OpenAI-Service-Tier pranon vetëm ultrafast. Dërgimi i një vlere tjetër, përfshirë default, fast ose flex, kthen një gabim HTTP 400. Mos e përfshini këtë fushë të kreut kur përdorni një nivel tjetër.
A mund ta përdor Ultrafast në Punë ose Codex?
Ultrafast ofrohet edhe në Punë dhe Codex për planet dhe hapësirat e punës që plotësojnë kushtet. Kushtet e planeve të ChatGPT dhe përdorimi në to ndryshojnë nga qasja përmes API-së.
Shihni ChatGPT Punë dhe Codex për hollësi mbi disponueshmërinë dhe përdorimin.
