OpenAI
Ang page na ito ay isinalin ng AI. Tingnan ang orihinal na artikulo sa English.

FAQ tungkol sa Fast mode

Mga madalas itanong tungkol sa Fast mode at sa Antas ng Serbisyo na Ultrafast.

Na-update: yesterday

Nag-aalok kami ng Fast mode para sa mga customer ng API na gustong magkaroon ng mas mabilis at mas pare-parehong performance sa ilang modelo. Nasa ibaba ang mga sagot sa mga karaniwang tanong tungkol sa kung paano ito gumagana, pagpepresyo, availability ng modelo, mga rate limit, pagiging maaasahan, mga patakaran, at pagiging kwalipikado.

Tandaan: Pinalitan ang pangalan ng Priority processing at ginawa itong Fast mode noong Hulyo 30, 2026. Maaari mong gamitin ang service_tier: priority o service_tier: fast sa iyong mga kahilingan sa API. 

Matuto pa rito.

Available ba ang Fast mode sa lahat ng rehiyon?

Nakadepende ang availability ng Fast mode sa mga naaangkop na batas at regulasyon sa bawat hurisdiksyon. Makipag-ugnayan sa iyong Account Director kung mayroon kang mga tanong tungkol sa availability sa iyong rehiyon.

Paano ito gumagana

Puwedeng idirekta ng mga customer ang traffic sa Fast mode para sa bawat request gamit ang kasalukuyang service_tier parameter, sa pamamagitan ng opsyong service_tier = "fast".

Sisingilin kada token ang mga token na pinoproseso ng Fast mode, sa presyong mas mataas kaysa sa mga singil sa Standard na pagproseso.

Bukod sa pag-configure nito sa bawat request, puwede mo ring gawing default ang Fast mode para sa isang proyekto sa Mga setting ng proyekto > Default na Antas ng Serbisyo: Fast. Puwede mo pa ring baguhin ito para sa bawat request. Ang pagpili ng Fast sa mga setting ng proyekto mo ay katumbas ng pagpili ng Priority.

Paano ito gumagana kaugnay ng Antas ng Scale?

Mananatiling hiwalay sa Fast mode ang Antas ng Scale. Hiwalay na sisingilin ang mga request na ipinadala sa Fast mode at hindi ibabawas ang mga ito sa binili mong mga TPM bundle ng Antas ng Scale.

Puwede ko bang awtomatikong ipadala sa Fast mode ang traffic na lampas sa kapasidad ng aking Antas ng Scale?

Hindi. Hindi awtomatikong ililipat sa Fast mode ang traffic na ipinadala sa Antas ng Scale kapag lumampas ito sa kapasidad.

Paano sinisingil ang Fast mode?

Sisingilin kada token ang mga token na pinoproseso ng Fast mode, sa presyong mas mataas kaysa sa mga singil sa Standard na pagproseso.

Nakatali ba sa isang partikular na mode ng pagproseso ang taunang halagang napagkasunduan kong gastusin?

Hindi. Ang paggastos sa lahat ng mode ng pagproseso ay ibinibilang sa taunang halagang napagkasunduan mong gastusin sa Enterprise.

May diskuwento pa rin ba ako sa mga naka-cache na input token?

Oo! May parehong 50-75% na diskuwento ang mga naka-cache na input gaya ng sa Standard na pagproseso.

Paano ko makikita ang paggamit at paggastos ko sa Fast mode?

Para makita ang mga token na pinroseso ng Fast mode (dating Priority na pagproseso), pumunta sa dashboard ng Paggamit, piliin ang Chat Completions o Responses, at Igrupo ayon sa Antas ng Serbisyo.

Para makita ang gastos sa Fast mode, pumunta sa dashboard ng Paggamit, at piliin ang Igrupo ayon sa Item sa Singil.

Sa dashboard ng Paggamit, patuloy na lalabas bilang priority ang mga request na gumagamit ng priority o fast bilang service_tier. Ia-update ito para sa mga susunod na modelo.

Mga modelo

Available ba ang Fast mode para sa mahabang konteksto, mga modelong na-fine-tune, mga embedding, atbp.?

Hindi pa sa ngayon. Susuriin namin sa hinaharap kung iaalok ang Fast mode sa iba pang produkto bukod sa aming mga pinakabagong modelo.

Paano gumagana ang iba pang modality sa Fast mode?

Sinusuportahan ng Fast mode ang parehong mga multimodal na kakayahan na available sa Standard. Partikular na magagamit ang mga larawan bilang input sa Priority na pagproseso, at pinoproseso ang mga ito nang may parehong mababang latency.

Susuportahan ba ang mga susunod na modelo?

Plano naming mag-alok ng Fast mode sa mga bagong modelo ng GPT, pero hindi namin ginagarantiyang susuportahan ang bawat modelo.

Mga rate limit

Ano ang mga rate limit?

Para sa mga rate limit, itinuturing na kapareho ng karaniwang API traffic ang paggamit ng Priority na pagproseso.

Ano ang mga limitasyon sa ramp rate?

May mga limitasyon sa ramp rate ang Fast mode para matiyak ang palaging mahusay na performance para sa lahat ng customer, habang nag-aalok pa rin ng flexible na pagpepresyo batay sa pangangailangan. Kung (a) humihina ang performance ng Fast mode AT (b) masyadong mabilis ang pagdami ng traffic ng isang customer, maaaring ibaba sa Standard na pagproseso ang ilang request sa mga bihirang pagkakataon.

Nakatakda rito sa aming pangunahing dokumentasyon ang kasalukuyang limitasyon sa ramp rate ng Fast mode.

Mga pinakamahusay na paraan para hindi lumampas sa iyong limitasyon sa ramp rate

Unti-unting dagdagan ang traffic kapag nagpapalit ng modelo. Halimbawa, kung lumilipat ang application mo mula sa dating snapshot tungo sa bago, gumamit ng feature flag para ilipat ang traffic sa loob ng ilang oras sa halip na sabay-sabay.

Iwasang magpatakbo sa Fast mode ng mga trabahong nagpoproseso ng malaking dami ng data o tumatakbo nang asynchronous. Maaaring napakabilis magpadami ng traffic ang mga trabahong ito, at kadalasan ay hindi nila kailangan ang pinahusay na performance ng Fast mode.

Kung madalas mong naaabot ang mga limitasyon sa ramp rate, pag-isipang bumili na lang ng quota sa Antas ng Scale.

Iisa ba ang mga limitasyon sa ramp rate para sa lahat ng proyekto o organisasyon ko?

Oo, binibilang ang lahat ng traffic mo sa iisang limitasyon sa ramp rate.

Mga patakaran

Ano ang mangyayari kung hindi naaabot ng Fast mode ang target na latency?

Makipag-ugnayan sa iyong AD para sa anumang tanong o alalahanin. Pareho ang magiging pagtrato sa mga SLA ng Fast mode at sa mga SLA ng Antas ng Scale; mag-aalok ng credits sa serbisyo kung hindi namin matugunan ang mga SLA na iyon para sa mga customer na may kasunduan sa Enterprise sa loob ng isang takdang panahon.

Compatible ba ang Fast mode sa lokasyon ng data?

Oo.

Compatible ba ang Fast mode sa ZDR at BAA?

Oo.

Ultrafast para sa GPT-6 Astra

Ang Ultrafast ay hiwalay na Antas ng Serbisyo para sa mga workload na nangangailangan ng mas mabilis na tugon ng GPT-6 Astra, gaya ng mga interactive na application at workflow sa pag-code.

Nalalapat ang mga gabay sa pagpepresyo, rate limit, at patakaran ng Fast mode sa mga request na gumagamit ng service_tier="fast". Ginagamit ng mga Ultrafast request ang hiwalay na antas na service_tier="ultrafast".

Paano ako magpapadala ng Ultrafast request?

Para sa organisasyong may access sa Ultrafast, gamitin ang Responses API kasama ang:

  • Modelo: gpt-6-astra

  • Antas ng Serbisyo: ultrafast

  • Header ng request: OpenAI-Service-Tier: ultrafast

Kailangan ang request header bukod pa sa setting ng Antas ng Serbisyo.

Para sa mga application na nagsasagawa ng mga tool call, nagbibigay-daan ang WebSocket mode na gamitin muli ang isang koneksyon sa magkakasunod na palitan at mabawasan ang dagdag na oras at resource para sa pagkonekta.

Puwede ko bang gamitin ang parehong request header para sa iba pang Antas ng Serbisyo?

Sa alpha ng Ultrafast, ultrafast lang ang tinatanggap ng header na OpenAI-Service-Tier. Magbabalik ng HTTP 400 error ang pagpapadala ng ibang value, kabilang ang default, fast, o flex. Huwag isama ang header na ito kapag gumagamit ng ibang antas.

Puwede ko bang gamitin ang Ultrafast sa Work o Codex?

Available din ang Ultrafast sa Work at Codex para sa mga kwalipikadong plan at workspace. Iba ang mga kwalipikadong ChatGPT plan at mga tuntunin sa paggamit kumpara sa access sa API.

Tingnan ang ChatGPT Work at Codex para sa mga detalye ng availability at paggamit.

Nakatulong ba ang artikulong ito?