Kami menawarkan Mode Cepat bagi pelanggan API yang menginginkan akses ke performa yang lebih cepat dan konsisten pada model tertentu. Berikut jawaban atas pertanyaan umum tentang cara kerjanya, harga, ketersediaan model, batas laju, keandalan, kebijakan, dan kelayakan.
Catatan: Pemrosesan Prioritas berganti nama menjadi Mode Cepat pada 30 Juli 2026. Anda dapat menggunakan service_tier: priority atau service_tier: fast dalam permintaan API Anda.
Pelajari selengkapnya di sini.
Apakah Mode Cepat tersedia di semua wilayah?
Ketersediaan Mode Cepat bergantung pada hukum dan peraturan yang berlaku di setiap yurisdiksi. Silakan hubungi Direktur Akun Anda jika memiliki pertanyaan tentang ketersediaan di wilayah Anda.
Cara kerja
Pelanggan dapat mengarahkan trafik ke Mode Cepat untuk setiap permintaan menggunakan parameter service_tier yang sudah ada, dengan opsi service_tier = "fast".
Token yang diproses oleh Mode Cepat akan ditagih per token, dengan tarif lebih tinggi daripada pemrosesan Standar.
Selain mengaturnya untuk setiap permintaan, Anda juga dapat menjadikan Mode Cepat sebagai default proyek melalui Pengaturan proyek > Tingkat Layanan Default: Cepat. Anda tetap dapat mengganti pengaturan ini untuk setiap permintaan. Memilih Cepat di pengaturan proyek sama dengan memilih Prioritas.
Bagaimana kaitannya dengan Tingkat Skala?
Tingkat Skala akan tetap terpisah dari Mode Cepat. Permintaan yang dikirim ke Mode Cepat akan ditagih secara terpisah dan tidak akan mengurangi kuota paket TPM Tingkat Skala yang telah Anda beli.
Apakah saya bisa secara otomatis mengalihkan trafik yang melebihi kuota Tingkat Skala ke Mode Cepat?
Tidak. Trafik yang dikirim ke Tingkat Skala tidak akan otomatis dialihkan ke Mode Cepat jika melebihi kuota.
Bagaimana penagihan Mode Cepat dilakukan?
Token yang diproses oleh Mode Cepat akan ditagih per token, dengan tarif lebih tinggi daripada pemrosesan Standar.
Apakah komitmen tahunan saya terikat pada mode pemrosesan tertentu?
Tidak. Penggunaan semua mode pemrosesan diperhitungkan dalam pemenuhan komitmen belanja Enterprise tahunan Anda.
Apakah saya tetap mendapatkan diskon untuk token input yang di-cache?
Ya! Input yang di-cache mendapatkan diskon 50–75%, sama seperti pada pemrosesan Standar.
Bagaimana cara melihat penggunaan dan pengeluaran Mode Cepat saya?
Untuk melihat token yang diproses oleh Mode Cepat (sebelumnya disebut pemrosesan Prioritas), buka dasbor Penggunaan, pilih Chat Completions atau Responses, lalu Kelompokkan menurut Tingkat Layanan.
Untuk melihat biaya Mode Cepat, buka dasbor Penggunaan, lalu pilih Kelompokkan menurut Item Tagihan.
Pada dasbor Penggunaan, permintaan yang menggunakan priority maupun fast sebagai service_tier akan tetap ditampilkan sebagai priority. Hal ini akan diperbarui untuk model mendatang.
Model
Apakah Mode Cepat tersedia untuk konteks panjang, model yang telah di-fine-tune, embedding, dan sebagainya?
Saat ini belum. Ke depannya, kami akan mengevaluasi kemungkinan menawarkan Mode Cepat untuk produk lain di luar model terbaru kami.
Bagaimana modalitas lain bekerja dengan Mode Cepat?
Mode Cepat mendukung kemampuan multimodal yang sama dengan yang tersedia pada Standar. Secara khusus, gambar dapat digunakan sebagai input untuk pemrosesan Prioritas dan diproses dengan latensi yang sama rendahnya.
Apakah model mendatang akan didukung?
Kami berencana menawarkan Mode Cepat pada model GPT baru, tetapi kami tidak menjamin bahwa setiap model akan didukung.
Batas laju
Apa saja batas lajunya?
Dalam penerapan batas laju, penggunaan pemrosesan Prioritas diperlakukan sama dengan trafik API standar.
Apa saja batas laju peningkatannya?
Mode Cepat memiliki batas laju peningkatan untuk memastikan performa yang tetap tinggi bagi semua pelanggan, sekaligus menawarkan harga yang fleksibel sesuai pemakaian. Jika (a) performa Mode Cepat menurun DAN (b) trafik pelanggan meningkat terlalu cepat, dalam kasus yang jarang terjadi, beberapa permintaan mungkin dialihkan ke pemrosesan Standar.
Batas laju peningkatan Mode Cepat yang berlaku saat ini dijelaskan dalam dokumentasi utama kami di sini.
Praktik terbaik agar tetap berada dalam batas laju peningkatan Anda
Tingkatkan trafik secara bertahap saat mengganti model. Misalnya, jika aplikasi Anda beralih dari snapshot sebelumnya ke snapshot baru, gunakan flag fitur untuk mengalihkan trafik secara bertahap selama beberapa jam, bukan sekaligus.
Hindari menjalankan pemrosesan data berskala besar atau tugas asinkron pada Mode Cepat. Tugas-tugas ini dapat meningkatkan trafik dengan sangat cepat dan sering kali tidak memerlukan peningkatan performa yang ditawarkan Mode Cepat.
Jika Anda sering mencapai batas laju peningkatan, pertimbangkan untuk membeli kuota Tingkat Skala sebagai alternatif.
Apakah batas laju peningkatan berlaku bersama untuk semua proyek atau organisasi saya?
Ya, seluruh trafik Anda diperhitungkan dalam batas laju peningkatan yang sama.
Kebijakan
Apa yang terjadi jika Mode Cepat tidak memenuhi target latensi?
Silakan hubungi AD Anda jika ada pertanyaan atau kekhawatiran. SLA Mode Cepat akan diperlakukan sama dengan SLA Tingkat Skala; kredit layanan akan ditawarkan jika kami gagal memenuhi SLA tersebut bagi pelanggan dengan perjanjian Enterprise dalam rentang waktu tertentu.
Apakah Mode Cepat kompatibel dengan residensi data?
Ya.
Apakah Mode Cepat kompatibel dengan ZDR dan BAA?
Ya.
Ultrafast untuk GPT-6 Astra
Ultrafast adalah Tingkat Layanan terpisah untuk beban kerja yang membutuhkan respons GPT-6 Astra dengan latensi lebih rendah, seperti aplikasi interaktif dan alur kerja pemrograman.
Panduan harga, batas laju, dan kebijakan Mode Cepat berlaku untuk permintaan yang menggunakan service_tier="fast". Permintaan Ultrafast menggunakan tingkat terpisah, yaitu service_tier="ultrafast".
Bagaimana cara mengirim permintaan Ultrafast?
Untuk organisasi yang memiliki akses Ultrafast, gunakan Responses API dengan:
Model:
gpt-6-astraTingkat Layanan:
ultrafastHeader permintaan:
OpenAI-Service-Tier: ultrafast
Selain pengaturan tingkat layanan, header permintaan juga wajib disertakan.
Untuk aplikasi yang menjalankan panggilan alat, mode WebSocket memungkinkan Anda menggunakan kembali koneksi di berbagai giliran percakapan dan mengurangi overhead koneksi.
Apakah saya bisa menggunakan header permintaan yang sama untuk Tingkat Layanan lain?
Selama tahap alfa Ultrafast, header OpenAI-Service-Tier hanya menerima ultrafast. Mengirim nilai lain, termasuk default, fast, atau flex, akan menghasilkan error HTTP 400. Jangan sertakan header ini saat menggunakan tingkat lain.
Apakah saya bisa menggunakan Ultrafast di Work atau Codex?
Ultrafast juga tersedia di Work dan Codex untuk paket dan ruang kerja yang memenuhi syarat. Persyaratan paket dan penggunaan di ChatGPT berbeda dari akses API.
Lihat ChatGPT Work dan Codex untuk detail ketersediaan dan penggunaan.
