Pautan Penting
Papan Pemuka Kesihatan Perkhidmatan (pada masa ini hanya tersedia kepada pelanggan API Enterprise)
Mulakan dengan Tetapan Lalai yang Betul
Apabila anda membuka papan pemuka Kesihatan Perkhidmatan, tetapan lalainya ialah:
Semua projek
30 hari terakhir
Resolusi setiap jam
Paparan ini hanya berguna untuk orientasi. Penyelesaian masalah yang bermakna sentiasa memerlukan penapisan.
Tapis Sebelum Menyiasat
Penapisan yang betul ialah langkah paling penting. Kebanyakan salah tafsir berlaku kerana model, peringkat atau projek dicampuradukkan.
Tapis mengikut Model (Satu demi Satu)
Sentiasa tapis kepada satu model sahaja.
Sebab:
Isu pada model trafik rendah boleh disembunyikan oleh trafik bervolum lebih tinggi
Model bervolum tinggi boleh membuat isu setempat kelihatan seperti isu global
Model yang berbeza mempunyai sasaran prestasi yang berbeza
Nota: memilih berbilang model akan mengagregatkannya—bukan bertukar antara model tersebut.
Tapis mengikut Peringkat Perkhidmatan
Jika anda menggunakan lebih daripada satu peringkat (standard, Mod pantas (sebelum ini Pemprosesan keutamaan), Peringkat Skala), sentiasa tapis mengikut peringkat yang sedang anda siasat.
Sebabnya:
Setiap peringkat mempunyai ciri prestasi yang berbeza
Mod pantas dan Peringkat Skala mempunyai SLA yang ditetapkan
Percampuran peringkat menyembunyikan prestasi peringkat berbayar
Ini amat penting untuk analisis kependaman.
Bagi model sedia ada, trafik Mod pantas masih dipaparkan sebagai priority dalam papan pemuka Penggunaan.
Tapis mengikut Projek
Secara lalai, Kesihatan Perkhidmatan menunjukkan semua projek.
Untuk penyelesaian masalah, tapis kepada projek yang mengalami isu tersebut.
Sebab:
Satu projek bervolum tinggi boleh mendominasi metrik.
Projek terjejas yang lebih kecil boleh ditutupi oleh trafik yang tidak berkaitan.
Biarkan “Semua projek” dipilih hanya jika anda percaya isu itu benar-benar melibatkan seluruh organisasi.
Menyelesaikan Ralat
Gunakan Paparan Permintaan HTTP
Untuk menyiasat ralat:
Tapis mengikut model dan peringkat perkhidmatan.
Buka tab Permintaan HTTP dan bukannya tab Masa Aktif.
Paparan ini menunjukkan jumlah permintaan dan bilangan ralat mengikut kod status HTTP. Zum kepada resolusi per minit untuk mengenal pasti lonjakan atau perubahan yang terperinci.
Tafsir Kadar Ralat, Bukan Bilangan
Sesetengah ralat adalah dijangka dalam mana-mana sistem produksi. Tumpukan pada peratusan ralat, bukan jumlah mentah.
Semakin besar jumlah volum anda, semakin besar kemungkinan bilangan ralat walaupun kadar ralat amat rendah.
Apabila Ralat Tiada dalam Kesihatan Perkhidmatan
Jika anda melihat ralat di sisi klien tetapi tiada data sepadan dalam Kesihatan Perkhidmatan:
Permintaan berkemungkinan tidak sampai ke OpenAI.
Isu biasanya berlaku di huluan (tamat masa, proksi, rangkaian).
Ini biasa berlaku dengan tamat masa sisi klien yang terlalu agresif.
Menyelesaikan Masalah Kependaman
Analisis kependaman paling bermakna untuk peringkat Mod pantas dan Peringkat Skala yang mempunyai SLA yang ditetapkan. Peringkat standard mungkin menunjukkan variasi kependaman yang lebih besar dan tidak mempunyai jaminan kependaman.
Metrik Utama
Untuk melihat setiap metrik, klik tab yang berkaitan:
Halaju Token: Token yang dijana sesaat; tidak bergantung pada saiz gesaan.
Masa Permintaan: Jumlah tempoh permintaan; sangat dipengaruhi oleh saiz output dan penaakulan.
Masa ke Token Pertama (TTFT): Masa sehingga token pertama dijana; sangat dipengaruhi oleh saiz gesaan input yang tidak dicache dan penaakulan.
Sentiasa semak persentil P50 / P75 / P95. Purata boleh menyembunyikan kesan terhadap pengguna sebenar.
6. Mengaitkan Kelewatan dengan Penggunaan Token
Kesihatan Perkhidmatan menunjukkan bila tingkah laku berubah. Data Penggunaan membantu menjelaskan sebabnya.
Dalam papan pemuka Penggunaan, lakukan perkara berikut untuk memastikan anda melihat data yang berkaitan dengan paparan anda dalam Papan Pemuka Kesihatan Perkhidmatan:
Tapis kepada projek dan model yang sama.
Kumpulkan mengikut peringkat perkhidmatan, jika berkenaan.
Tumpukan pada token output, yang paling kuat mempengaruhi kelewatan.
Untuk analisis lebih mendalam, eksport Data Aktiviti dan periksa token bagi setiap permintaan mengikut masa.
7. Maklumat untuk Dikongsi dengan Sokongan (Jika Perlu)
Jika anda menghubungi sokongan, sertakan:
ID Organisasi yang terjejas (penting)
Titik akhir yang terjejas, seperti Chat Completions atau Responses (penting)
Model yang terjejas (penting)
Sama ada isu berlaku pada Mod pantas atau Peringkat Skala (penting)
Julat masa berserta zon waktu bagi kependaman atau ralat (penting)
x-request-id atau X-Client-Request-Id yang berkaitan, jika tersedia
Cap masa berserta zon waktu, atau sekurang-kurangnya tarikh, bagi permintaan yang anda berikan
Jika tersedia, sertakan juga:
ID Projek yang berkaitan dengan permintaan tersebut
Sama ada permintaan lokasi data terjejas dan permintaan yang terjejas
Penerangan tentang trend yang anda lihat
Bagi jenis isu, sertakan:
Ralat: Anggaran peratusan permintaan yang gagal atau mengalami ralat, kod respons, mesej ralat dan tempoh yang diambil untuk menerima respons ralat.
Kependaman: Persentil yang terjejas (P50 / P90 / P95 / P99), tahap peningkatannya berbanding garis dasar pelanggan dan contoh permintaan perlahan berserta cap masa penghantaran dan penerimaan.
Kedua-duanya: Tangkapan skrin atau jadual data ralat atau kependaman, serta cara anda menentukan bahawa kadar ralat atau kependaman lebih tinggi daripada jangkaan.
Senario Penyelesaian Masalah Biasa
Tamat Masa Berlaku tetapi Kesihatan Perkhidmatan Kelihatan Normal
Kemungkinan punca: permintaan tamat masa sebelum sampai ke OpenAI.
Semak:
Tetapan tamat masa klien atau proksi
Perubahan rangkaian setempat atau pengimbang beban
Kehadiran ralat 499 dalam papan pemuka Kesihatan Perkhidmatan (ini mungkin muncul sebagai ralat 5xx dalam sistem anda sendiri).
Kelewatan Meningkat Tanpa Pelaksanaan Baharu
Kemungkinan punca: saiz token output atau penggunaan penaakulan meningkat dan/atau trafik beralih antara peringkat perkhidmatan.
Semak:
Purata token output bagi setiap permintaan dalam papan pemuka Penggunaan (memerlukan anda memuat turun data dan membahagikan token output dengan jumlah permintaan).
Persentil Masa Permintaan dan TTFT dalam papan pemuka Kesihatan Perkhidmatan.
Mod pantas atau Peringkat Skala Kelihatan Perlahan
Punca yang mungkin: metrik daripada beberapa peringkat bercampur, menyebabkan trafik peringkat standard menyembunyikan prestasi peringkat berbayar.
Semak:
Penapis dihadkan kepada satu peringkat dan model sahaja.
Perbandingan kelajuan token antara peringkat.
Lonjakan Ralat 5XX
Kemungkinan punca: kegagalan sementara yang menjejaskan peratusan kecil trafik.
Semak:
Peratusan kadar ralat
Sama ada volum trafik berubah pada masa yang sama
Isu Hanya Menjejaskan Satu Projek
Kemungkinan punca: konfigurasi atau corak penggunaan khusus projek.
Semak:
Penapisan peringkat projek
Perbandingan dengan projek yang tidak terjejas
Kesimpulan Utama
Tapis mengikut model, peringkat dan projek yang berkaitan sebelum mentafsir metrik.
Gunakan persentil, bukan purata, untuk analisis kelewatan.
Kadar ralat yang kecil adalah dijangka.
Data yang tiada biasanya menunjukkan isu huluan.
Data Penggunaan boleh membantu menjelaskan sebab kelewatan berubah; Kesihatan Perkhidmatan menunjukkan bila tingkah laku berubah.
