OpenAI
Ang page na ito ay isinalin ng AI. Tingnan ang orihinal na artikulo sa English.

FAQ tungkol sa Fast mode

Mga madalas itanong tungkol sa Fast mode

Na-update: 15 days ago

Nag-aalok kami ng Fast mode para sa mga customer ng API na gustong magkaroon ng mas mabilis at mas pare-parehong performance sa ilang modelo. Nasa ibaba ang mga sagot sa mga karaniwang tanong tungkol sa kung paano ito gumagana, pagpepresyo, availability ng modelo, mga rate limit, pagiging maaasahan, mga patakaran, at pagiging kwalipikado.

Tandaan: Pinalitan ang pangalan ng Priority processing at ginawa itong Fast mode noong Hulyo 30, 2026. Maaari mong gamitin ang service_tier: priority o service_tier: fast sa iyong mga kahilingan sa API. 

Matuto pa rito.

Available ba ang Fast mode sa lahat ng rehiyon?

Nakadepende ang availability ng Fast mode sa mga naaangkop na batas at regulasyon sa bawat hurisdiksyon. Makipag-ugnayan sa iyong Account Director kung mayroon kang mga tanong tungkol sa availability sa iyong rehiyon.

Paano ito gumagana

Maaaring idirekta ng mga customer ang traffic sa Fast mode sa bawat kahilingan gamit ang kasalukuyang parameter na service_tier at ang opsyong service_tier = "fast".

Sisingilin kada token ang mga token na pinroseso ng Fast mode, sa presyong mas mataas kaysa sa mga rate ng Standard processing.

Bukod sa pag-configure nito sa antas ng kahilingan, maaari mo ring itakda ang Fast mode bilang default ng isang proyekto sa Project settings > Default Service Tier: Fast. Maaari mo pa rin itong i-override sa bawat kahilingan. Ang pagpili sa Fast sa mga setting ng iyong proyekto ay katumbas ng pagpili sa Priority.

Paano ito gumagana kasama ng Antas ng Scale?

Mananatiling hiwalay ang Antas ng Scale sa Fast mode. Hiwalay na sisingilin ang mga kahilingang ipinadala sa Fast mode at hindi ibabawas ang mga ito sa binili mong mga TPM bundle ng Antas ng Scale.

Maaari ko bang awtomatikong ipadala sa Fast mode ang sobrang traffic mula sa Antas ng Scale?

Hindi. Hindi awtomatikong ililipat sa Fast mode ang sobrang traffic na ipinadala sa Antas ng Scale.

Paano sinisingil ang Fast mode?

Sisingilin kada token ang mga token na pinroseso ng Fast mode, sa presyong mas mataas kaysa sa mga rate ng Standard processing.

Nakaugnay ba sa isang partikular na processing mode ang taunang commitment ko?

Hindi. Ang lahat ng processing mode ay ibinibilang sa iyong taunang commitment sa paggastos para sa Enterprise.

Makakakuha pa rin ba ako ng diskuwento sa mga naka-cache na input token?

Oo! Makakatanggap ang mga naka-cache na input ng parehong 50–75% diskuwento gaya sa Standard processing.

Paano ko makikita ang paggamit at gastos ko sa Fast mode?

Para makita ang mga token na pinroseso ng Fast mode (dating Priority processing), pumunta sa dashboard ng Usage, piliin ang Chat Completions o Responses, at piliin ang Group by Service Tier.

Para makita ang gastos sa Fast mode, pumunta sa dashboard ng Usage at piliin ang Group by Line Item.

Sa dashboard ng Usage, patuloy na lalabas bilang priority ang mga kahilingang gumagamit ng priority o fast bilang service_tier. Ia-update ito para sa mga modelo sa hinaharap.

Mga modelo

Available ba ang Fast mode para sa mahabang context, mga fine-tuned na modelo, embedding, at iba pa?

Hindi sa ngayon. Susuriin namin sa hinaharap kung iaalok ang Fast mode sa mga karagdagang produkto bukod sa aming mga pinakabagong modelo.

Paano gumagana ang iba pang modality sa Fast mode?

Sinusuportahan ng Fast mode ang parehong mga multimodal na kakayahang available sa Standard. Sa partikular, maaaring gamiting input ang mga larawan sa Priority processing at pinoproseso ang mga ito nang kasingbilis.

Susuportahan ba ang mga modelo sa hinaharap?

Plano naming ialok ang Fast mode sa mga bagong modelo ng GPT, ngunit hindi namin ginagarantiya na susuportahan ang bawat modelo.

Mga rate limit

Ano ang mga rate limit?

Para sa mga rate limit, itinuturing na kapareho ng karaniwang API traffic ang paggamit ng Priority processing.

Ano ang mga ramp rate limit?

May mga ramp rate limit ang Fast mode upang matiyak ang tuloy-tuloy na mataas na performance para sa lahat ng customer habang nagbibigay pa rin ng flexible at on-demand na pagpepresyo. Sa mga bihirang pagkakataon, kung (a) bumaba ang performance ng Fast mode AT (b) masyadong mabilis ang pagtaas ng traffic ng isang customer, maaaring ilipat sa Standard processing ang ilang kahilingan.

Makikita rito sa aming pangunahing dokumentasyon ang kasalukuyang ramp rate limit ng Fast mode.

Mga pinakamahusay na paraan upang manatili sa loob ng iyong ramp rate limit

Unti-unting dagdagan ang traffic kapag nagpapalit ng mga modelo. Halimbawa, kung lilipat ang iyong application mula sa dating snapshot patungo sa bago, gumamit ng feature flag upang unti-unting ilipat ang traffic sa loob ng ilang oras sa halip na ilipat ito nang sabay-sabay.

Iwasang magpatakbo ng malakihang pagpoproseso ng data o mga asynchronous na job sa Fast mode. Maaaring napakabilis na mapataas ng mga job na ito ang traffic, at kadalasan ay hindi kailangan ng mga ito ang mas mahusay na performance ng Fast mode.

Kung palagi mong naaabot ang mga ramp rate limit, pag-isipang bumili na lang ng quota sa Antas ng Scale.

Pinagsasaluhan ba ng aking mga proyekto o organisasyon ang mga ramp rate limit?

Oo, ang lahat ng traffic mo ay ibinibilang sa iisang ramp rate limit.

Mga patakaran

Ano ang mangyayari kung hindi naaabot ng Fast mode ang target na latency?

Makipag-ugnayan sa iyong AD kung mayroon kang anumang tanong o alalahanin. Ituturing ang mga SLA ng Fast mode na kapareho ng mga SLA ng Antas ng Scale. Magbibigay ng service credits kung hindi namin maabot ang mga SLA na iyon para sa mga customer na may Enterprise agreement sa isang partikular na yugto ng panahon.

Compatible ba ang Fast mode sa lokasyon ng data?

Oo.

Compatible ba ang Fast mode sa ZDR at BAA?

Oo.

Nakatulong ba ang artikulong ito?