OpenAI
Halaman ini diterjemah oleh mesin. Lihat artikel asal dalam bahasa Inggeris.

Soalan Lazim Pemprosesan Priority

Soalan lazim tentang Mod pantas dan peringkat perkhidmatan Ultrafast.

Dikemas kini: 2 days ago

Kami kini menawarkan pemprosesan Priority untuk pelanggan API Enterprise yang mahukan akses kepada prestasi yang lebih pantas dan lebih konsisten pada model tertentu. Di bawah ialah jawapan kepada soalan lazim tentang cara ia berfungsi, harga, ketersediaan model, had kadar, kebolehpercayaan, dasar dan kelayakan.

Ketahui lebih lanjut di sini.

Cara ia berfungsi

Pelanggan boleh menghalakan trafik ke Mod pantas bagi setiap permintaan menggunakan parameter service_tier sedia ada, dengan pilihan service_tier = "fast".

Token yang diproses oleh Mod pantas akan dibilkan bagi setiap token, pada harga premium berbanding kadar pemprosesan Standard.

Selain menetapkannya pada peringkat permintaan, anda juga boleh menetapkan Mod pantas sebagai lalai untuk projek dalam Tetapan projek > Peringkat Perkhidmatan Lalai: Pantas. Anda masih boleh menggantikan tetapan ini bagi setiap permintaan. Memilih Pantas dalam tetapan projek anda adalah sama dengan memilih Keutamaan.

Bagaimanakah mod ini berfungsi bersama Peringkat Skala?

Peringkat Skala akan kekal berasingan daripada Mod pantas. Permintaan yang dihantar ke Mod pantas akan dibilkan secara berasingan dan tidak akan menggunakan peruntukan pakej TPM Peringkat Skala yang telah anda beli.

Bolehkah saya menghantar trafik limpahan Peringkat Skala saya ke Mod pantas secara automatik?

Tidak. Trafik yang dihantar ke Peringkat Skala tidak akan melimpah ke Mod pantas secara automatik.

Bagaimanakah Mod pantas dibilkan?

Token yang diproses oleh Mod pantas akan dibilkan bagi setiap token, pada harga premium berbanding kadar pemprosesan Standard.

Adakah komitmen tahunan saya terikat pada mod pemprosesan tertentu?

Tidak. Semua mod pemprosesan dikira untuk memenuhi komitmen perbelanjaan Enterprise tahunan anda.

Adakah saya masih mendapat diskaun untuk token input yang dicache?

Ya! Input yang dicache mendapat diskaun 50-75% yang sama seperti dalam pemprosesan Standard.

Bagaimanakah saya melihat penggunaan dan perbelanjaan Mod pantas saya?

Untuk melihat token yang diproses oleh Mod pantas (dahulunya dikenali sebagai pemprosesan Keutamaan), pergi ke papan pemuka Penggunaan, pilih Chat Completions atau Responses, kemudian Kumpulkan mengikut Peringkat Perkhidmatan.

Untuk melihat kos Mod pantas, pergi ke papan pemuka Penggunaan dan pilih Kumpulkan mengikut Item Baris.

Pada papan pemuka Penggunaan, permintaan yang menggunakan priority atau fast sebagai service_tier akan terus dipaparkan sebagai priority. Paparan ini akan dikemas kini untuk model akan datang.

Model

Adakah Mod pantas tersedia untuk konteks panjang, model yang diperhalus, pembenaman dan sebagainya?

Tidak buat masa ini. Pada masa hadapan, kami akan menilai sama ada Mod pantas patut ditawarkan untuk produk lain selain model terkini kami.

Bagaimanakah modaliti lain berfungsi dengan Mod pantas?

Mod pantas menyokong keupayaan multimodal yang sama seperti yang tersedia pada Standard. Khususnya, imej boleh digunakan sebagai input untuk pemprosesan Keutamaan dan diproses dengan kependaman rendah yang sama.

Adakah model akan datang akan disokong?

Kami merancang untuk menawarkan Mod pantas pada model GPT baharu, tetapi kami tidak menjamin bahawa setiap model akan disokong.

Had kadar

Apakah had kadar?

Penggunaan pemprosesan Keutamaan dikira sama seperti trafik API standard untuk tujuan had kadar.

Apakah had kadar ramp?

Mod pantas mempunyai had kadar ramp untuk memastikan prestasi yang konsisten tinggi bagi semua pelanggan, sambil terus menawarkan harga atas permintaan yang fleksibel. Jika (a) prestasi Mod pantas merosot DAN (b) trafik pelanggan meningkat terlalu cepat, sesetengah permintaan mungkin diturunkan ke pemprosesan Standard dalam keadaan yang jarang berlaku.

Had kadar ramp semasa untuk Mod pantas ditetapkan dalam dokumentasi utama kami di sini.

Amalan terbaik untuk kekal dalam had kadar ramp anda

Tingkatkan trafik secara beransur-ansur apabila menukar model. Contohnya, jika aplikasi anda beralih daripada petikan model terdahulu kepada yang baharu, gunakan bendera ciri untuk mengalihkan trafik dalam tempoh beberapa jam, bukannya sekali gus.

Elakkan menjalankan tugas pemprosesan data berskala besar atau tugas tak segerak dalam Mod pantas. Tugas ini boleh meningkatkan trafik dengan sangat cepat dan biasanya tidak memerlukan prestasi lebih baik yang ditawarkan oleh Mod pantas.

Jika anda kerap mencapai had kadar ramp, pertimbangkan untuk membeli kuota Peringkat Skala sebagai alternatif.

Adakah had kadar ramp dikongsi merentas projek atau organisasi saya?

Ya, semua trafik anda dikira dalam had kadar ramp yang sama.

Dasar

Apakah yang berlaku jika Mod pantas tidak memenuhi sasaran kependaman?

Sila hubungi AD anda jika ada sebarang soalan atau kebimbangan. SLA Mod pantas akan dikendalikan sama seperti SLA Peringkat Skala; kredit perkhidmatan akan ditawarkan jika kami gagal memenuhi SLA tersebut dalam tempoh masa tertentu bagi pelanggan yang mempunyai perjanjian Enterprise.

Adakah Mod pantas serasi dengan lokasi data?

Ya.

Adakah Mod pantas serasi dengan ZDR dan BAA?

Ya.

Ultrafast untuk GPT-6 Astra

Ultrafast ialah peringkat perkhidmatan berasingan untuk beban kerja yang memerlukan respons GPT-6 Astra dengan kependaman lebih rendah, seperti aplikasi interaktif dan aliran kerja pengekodan.

Panduan harga, had kadar dan dasar Mod pantas terpakai pada permintaan yang menggunakan service_tier="fast". Permintaan Ultrafast menggunakan peringkat service_tier="ultrafast" yang berasingan.

Bagaimanakah saya menghantar permintaan Ultrafast?

Untuk organisasi yang mempunyai akses Ultrafast, gunakan Responses API dengan tetapan berikut:

  • Model: gpt-6-astra

  • Peringkat perkhidmatan: ultrafast

  • Pengepala permintaan: OpenAI-Service-Tier: ultrafast

Pengepala permintaan diperlukan selain tetapan peringkat perkhidmatan.

Untuk aplikasi yang melaksanakan panggilan alat, mod WebSocket membolehkan anda menggunakan semula sambungan merentas giliran dan mengurangkan overhed sambungan.

Bolehkah saya menggunakan pengepala permintaan yang sama untuk peringkat perkhidmatan lain?

Semasa fasa alfa Ultrafast, pengepala OpenAI-Service-Tier hanya menerima ultrafast. Menghantar nilai lain, termasuk default, fast atau flex, akan menghasilkan ralat HTTP 400. Jangan sertakan pengepala ini apabila menggunakan peringkat lain.

Bolehkah saya menggunakan Ultrafast dalam Kerja atau Codex?

Ultrafast juga tersedia dalam Kerja dan Codex untuk pelan dan ruang kerja yang layak. Kelayakan dan penggunaan pelan ChatGPT berbeza daripada akses API.

Lihat ChatGPT Kerja dan Codex untuk butiran ketersediaan dan penggunaan.

Adakah artikel ini membantu?