OpenAI
Halaman ini diterjemah oleh mesin. Lihat artikel asal dalam bahasa Inggeris.

Menyelesaikan Ralat API dan Kelewatan

Artikel ini menerangkan cara menggunakan papan pemuka Kesihatan Perkhidmatan dan Penggunaan untuk menyelesaikan ralat biasa serta isu kependaman semasa menggunakan API OpenAI.

Dikemas kini: 2 days ago

Pautan Penting

Mulakan dengan Tetapan Lalai yang Betul

Apabila anda membuka papan pemuka Kesihatan Perkhidmatan, tetapan lalainya ialah:

  • Semua projek

  • 30 hari terakhir

  • Resolusi setiap jam

Paparan ini hanya berguna untuk orientasi. Penyelesaian masalah yang bermakna sentiasa memerlukan penapisan.

Tapis Sebelum Menyiasat

Penapisan yang betul ialah langkah paling penting. Kebanyakan salah tafsir berlaku kerana model, peringkat atau projek dicampuradukkan.

Tapis mengikut Model (Satu demi Satu)

Sentiasa tapis kepada satu model sahaja.

Sebab:

  • Isu pada model trafik rendah boleh disembunyikan oleh trafik bervolum lebih tinggi

  • Model bervolum tinggi boleh membuat isu setempat kelihatan seperti isu global

  • Model yang berbeza mempunyai sasaran prestasi yang berbeza

Nota: memilih berbilang model akan mengagregatkannya—bukan bertukar antara model tersebut.

Tapis mengikut Peringkat Perkhidmatan

Jika anda menggunakan lebih daripada satu peringkat (standard, Mod pantas (sebelum ini Pemprosesan keutamaan), Peringkat Skala), sentiasa tapis mengikut peringkat yang sedang anda siasat.

Sebabnya:

  • Setiap peringkat mempunyai ciri prestasi yang berbeza

  • Mod pantas dan Peringkat Skala mempunyai SLA yang ditetapkan

  • Percampuran peringkat menyembunyikan prestasi peringkat berbayar

Ini amat penting untuk analisis kependaman.

Bagi model sedia ada, trafik Mod pantas masih dipaparkan sebagai priority dalam papan pemuka Penggunaan.

Tapis mengikut Projek

Secara lalai, Kesihatan Perkhidmatan menunjukkan semua projek.

Untuk penyelesaian masalah, tapis kepada projek yang mengalami isu tersebut.

Sebab:

  • Satu projek bervolum tinggi boleh mendominasi metrik.

  • Projek terjejas yang lebih kecil boleh ditutupi oleh trafik yang tidak berkaitan.

Biarkan “Semua projek” dipilih hanya jika anda percaya isu itu benar-benar melibatkan seluruh organisasi.

Menyelesaikan Ralat

Gunakan Paparan Permintaan HTTP

Untuk menyiasat ralat:

  1. Tapis mengikut model dan peringkat perkhidmatan.

  2. Buka tab Permintaan HTTP dan bukannya tab Masa Aktif.

Paparan ini menunjukkan jumlah permintaan dan bilangan ralat mengikut kod status HTTP. Zum kepada resolusi per minit untuk mengenal pasti lonjakan atau perubahan yang terperinci.

Tafsir Kadar Ralat, Bukan Bilangan

Sesetengah ralat adalah dijangka dalam mana-mana sistem produksi. Tumpukan pada peratusan ralat, bukan jumlah mentah.

Semakin besar jumlah volum anda, semakin besar kemungkinan bilangan ralat walaupun kadar ralat amat rendah.

Apabila Ralat Tiada dalam Kesihatan Perkhidmatan

Jika anda melihat ralat di sisi klien tetapi tiada data sepadan dalam Kesihatan Perkhidmatan:

  • Permintaan berkemungkinan tidak sampai ke OpenAI.

  • Isu biasanya berlaku di huluan (tamat masa, proksi, rangkaian).

Ini biasa berlaku dengan tamat masa sisi klien yang terlalu agresif.

Menyelesaikan Masalah Kependaman

Analisis kependaman paling bermakna untuk peringkat Mod pantas dan Peringkat Skala yang mempunyai SLA yang ditetapkan. Peringkat standard mungkin menunjukkan variasi kependaman yang lebih besar dan tidak mempunyai jaminan kependaman.

Metrik Utama

Untuk melihat setiap metrik, klik tab yang berkaitan:

  • Halaju Token: Token yang dijana sesaat; tidak bergantung pada saiz gesaan.

  • Masa Permintaan: Jumlah tempoh permintaan; sangat dipengaruhi oleh saiz output dan penaakulan.

  • Masa ke Token Pertama (TTFT): Masa sehingga token pertama dijana; sangat dipengaruhi oleh saiz gesaan input yang tidak dicache dan penaakulan.

Sentiasa semak persentil P50 / P75 / P95. Purata boleh menyembunyikan kesan terhadap pengguna sebenar.

6. Mengaitkan Kelewatan dengan Penggunaan Token

Kesihatan Perkhidmatan menunjukkan bila tingkah laku berubah. Data Penggunaan membantu menjelaskan sebabnya.

Dalam papan pemuka Penggunaan, lakukan perkara berikut untuk memastikan anda melihat data yang berkaitan dengan paparan anda dalam Papan Pemuka Kesihatan Perkhidmatan:

  • Tapis kepada projek dan model yang sama.

  • Kumpulkan mengikut peringkat perkhidmatan, jika berkenaan.

  • Tumpukan pada token output, yang paling kuat mempengaruhi kelewatan.

Untuk analisis lebih mendalam, eksport Data Aktiviti dan periksa token bagi setiap permintaan mengikut masa.

7. Maklumat untuk Dikongsi dengan Sokongan (Jika Perlu)

Jika anda menghubungi sokongan, sertakan:

  • ID Organisasi yang terjejas (penting)

  • Titik akhir yang terjejas, seperti Chat Completions atau Responses (penting)

  • Model yang terjejas (penting)

  • Sama ada isu berlaku pada Mod pantas atau Peringkat Skala (penting)

  • Julat masa berserta zon waktu bagi kependaman atau ralat (penting)

  • x-request-id atau X-Client-Request-Id yang berkaitan, jika tersedia

  • Cap masa berserta zon waktu, atau sekurang-kurangnya tarikh, bagi permintaan yang anda berikan

Jika tersedia, sertakan juga:

  • ID Projek yang berkaitan dengan permintaan tersebut

  • Sama ada permintaan lokasi data terjejas dan permintaan yang terjejas

  • Penerangan tentang trend yang anda lihat

Bagi jenis isu, sertakan:

  • Ralat: Anggaran peratusan permintaan yang gagal atau mengalami ralat, kod respons, mesej ralat dan tempoh yang diambil untuk menerima respons ralat.

  • Kependaman: Persentil yang terjejas (P50 / P90 / P95 / P99), tahap peningkatannya berbanding garis dasar pelanggan dan contoh permintaan perlahan berserta cap masa penghantaran dan penerimaan.

  • Kedua-duanya: Tangkapan skrin atau jadual data ralat atau kependaman, serta cara anda menentukan bahawa kadar ralat atau kependaman lebih tinggi daripada jangkaan.

Senario Penyelesaian Masalah Biasa

Tamat Masa Berlaku tetapi Kesihatan Perkhidmatan Kelihatan Normal

Kemungkinan punca: permintaan tamat masa sebelum sampai ke OpenAI.

Semak:

  • Tetapan tamat masa klien atau proksi

  • Perubahan rangkaian setempat atau pengimbang beban

  • Kehadiran ralat 499 dalam papan pemuka Kesihatan Perkhidmatan (ini mungkin muncul sebagai ralat 5xx dalam sistem anda sendiri).

Kelewatan Meningkat Tanpa Pelaksanaan Baharu

Kemungkinan punca: saiz token output atau penggunaan penaakulan meningkat dan/atau trafik beralih antara peringkat perkhidmatan.

Semak:

  • Purata token output bagi setiap permintaan dalam papan pemuka Penggunaan (memerlukan anda memuat turun data dan membahagikan token output dengan jumlah permintaan).

  • Persentil Masa Permintaan dan TTFT dalam papan pemuka Kesihatan Perkhidmatan.

Mod pantas atau Peringkat Skala Kelihatan Perlahan

Punca yang mungkin: metrik daripada beberapa peringkat bercampur, menyebabkan trafik peringkat standard menyembunyikan prestasi peringkat berbayar.

Semak:

  • Penapis dihadkan kepada satu peringkat dan model sahaja.

  • Perbandingan kelajuan token antara peringkat.

Lonjakan Ralat 5XX

Kemungkinan punca: kegagalan sementara yang menjejaskan peratusan kecil trafik.

Semak:

  • Peratusan kadar ralat

  • Sama ada volum trafik berubah pada masa yang sama

Isu Hanya Menjejaskan Satu Projek

Kemungkinan punca: konfigurasi atau corak penggunaan khusus projek.

Semak:

  • Penapisan peringkat projek

  • Perbandingan dengan projek yang tidak terjejas

Kesimpulan Utama

  • Tapis mengikut model, peringkat dan projek yang berkaitan sebelum mentafsir metrik.

  • Gunakan persentil, bukan purata, untuk analisis kelewatan.

  • Kadar ralat yang kecil adalah dijangka.

  • Data yang tiada biasanya menunjukkan isu huluan.

  • Data Penggunaan boleh membantu menjelaskan sebab kelewatan berubah; Kesihatan Perkhidmatan menunjukkan bila tingkah laku berubah.

Adakah artikel ini membantu?