Lidhje të rëndësishme
Paneli i gjendjes së shërbimit (aktualisht i disponueshëm vetëm për klientët Enterprise API)
Filloni me parazgjedhjet e duhura
Kur hapni panelin e gjendjes së shërbimit, ai vendoset si parazgjedhje në:
Të gjitha projektet
30 ditët e fundit
Rezolucion orar
Kjo pamje është e dobishme vetëm për orientim. Zgjidhja kuptimplotë e problemeve kërkon gjithmonë filtrimin.
Filtroni përpara hetimit
Filtrimi i saktë është hapi më i rëndësishëm. Shumica e keqinterpretimeve vijnë nga përzierja e modeleve, niveleve ose projekteve.
Filtroni sipas modelit (një nga një)
Filtroni gjithmonë në një model të vetëm.
Pse:
Problemet në modelet me trafik të ulët mund të fshihen nga trafiku me vëllim më të lartë
Modelet me vëllim të lartë mund t'i bëjnë problemet lokale të duken globale
Modele të ndryshme kanë objektiva të ndryshme performance
Shënim: zgjedhja e disa modeleve i agregon ato—nuk kalon nga njëri te tjetri.
Filtro sipas nivelit të shërbimit
Nëse përdorni më shumë se një nivel (standard, modaliteti i shpejtë (më parë Përpunimi me përparësi), niveli i shkallëzimit), filtrojeni gjithmonë sipas nivelit që po hetoni.
Arsyeja:
Nivelet kanë karakteristika të ndryshme performance
Modaliteti i shpejtë dhe niveli i shkallëzimit kanë SLA të përcaktuara
Përzierja e niveleve fsheh performancën e nivelit me pagesë
Kjo është veçanërisht e rëndësishme për analizën e vonesës.
Për modelet ekzistuese, trafiku i modalitetit të shpejtë vazhdon të shfaqet si me përparësi në panelin e përdorimit.
Filtroni sipas projektit
Si parazgjedhje, Gjendja e shërbimit shfaq të gjitha projektet.
Për zgjidhjen e problemeve, filtroni në projektin/projektet ku u vëzhgua problemi.
Pse:
Një projekt i vetëm me vëllim të lartë mund të dominojë metrikat.
Projektet më të vogla të prekura mund të maskohen nga trafik i palidhur.
Lëreni të zgjedhur “Të gjitha projektet” vetëm nëse besoni se problemi është vërtet në të gjithë organizatën.
Zgjidhja e problemeve me gabimet
Përdorni pamjen e kërkesave HTTP
Për të hetuar gabimet:
Filtroni sipas modelit dhe nivelit të shërbimit.
Hapni skedën Kërkesat HTTP në vend të skedës Koha aktive.
Kjo pamje tregon kërkesat totale dhe numrin e gabimeve sipas kodit të statusit HTTP. Zmadhoni në rezolucion në nivel minute për të identifikuar rritje ose ndryshime të imëta.
Interpretoni shkallët e gabimeve, jo numërimet
Disa gabime janë të pritshme në çdo sistem prodhimi. Përqendrohuni te përqindja e gabimeve, jo te totalet bruto.
Sa më i madh të jetë vëllimi juaj total, aq më i madh është numri i mundshëm i gabimeve edhe me një shkallë gabimesh jashtëzakonisht të ulët.
Kur gabimet mungojnë nga Gjendja e shërbimit
Nëse shihni gabime në anën e klientit, por jo të dhëna përkatëse në Gjendjen e shërbimit:
Kërkesat ka gjasa të mos kenë arritur te OpenAI.
Problemi zakonisht është në rrjedhën e sipërme (skadime kohe, proxy, rrjetëzim).
Kjo është e zakonshme me skadime kohe agresive në anën e klientit.
Zgjidhja e problemeve me vonesën
Analiza e vonesës është më domethënëse në nivelet modaliteti i shpejtë dhe niveli i shkallëzimit, të cilat kanë SLA të përcaktuara. Niveli standard mund të shfaqë luhatje më të mëdha të vonesës dhe nuk ofron vonesë të garantuar.
Metrikat kryesore
Për të parë çdo metrikë, klikoni skedën përkatëse:
Shpejtësia e tokenëve: Tokenë të gjeneruar për sekondë; e pavarur nga madhësia e kërkesës.
Koha e kërkesës: Kohëzgjatja totale e kërkesës; ndikohet shumë nga madhësia e daljes dhe arsyetimi.
Koha deri te tokeni i parë (TTFT): Koha derisa gjenerohet tokeni i parë; ndikohet shumë nga madhësia e kërkesës hyrëse të paruajtur në cache dhe arsyetimi.
Rishikoni gjithmonë përqindëshit P50 / P75 / P95. Mesataret mund të fshehin ndikimin te përdoruesit realë.
Lidhja mes vonesës dhe përdorimit të tokenëve
Gjendja e shërbimit tregon kur ndryshoi sjellja. Të dhënat e përdorimit ndihmojnë të shpjegohet pse.
Në panelin e përdorimit, ndiqni këta hapa për t’u siguruar që po shikoni të dhënat që përputhen me pamjen tuaj në panelin e gjendjes së shërbimit:
Filtroni sipas të njëjtit projekt dhe model.
Gruponi sipas nivelit të shërbimit, nëse zbatohet.
Përqendrohuni te tokenët e daljes, të cilët ndikojnë më shumë në vonesë.
Për një analizë më të thelluar, eksportoni të dhënat e aktivitetit dhe shqyrtoni numrin e tokenëve për kërkesë me kalimin e kohës.
Çfarë t’i dërgoni ekipit të mbështetjes (nëse nevojitet)
Nëse kontaktoni ekipin e mbështetjes, përfshini:
ID-të e organizatave të prekura (e rëndësishme)
Pikat fundore të prekura, si Chat Completions ose Responses (e rëndësishme)
Modelet e prekura (e rëndësishme)
Nëse problemi shfaqet në modalitetin e shpejtë apo në nivelin e shkallëzimit (e rëndësishme)
Intervalet kohore kur shfaqen vonesat ose gabimet, duke përfshirë zonën kohore (e rëndësishme)
x-request-id ose X-Client-Request-Id përkatës, nëse disponohet
Datën dhe orën me zonën kohore, ose të paktën datën, për kërkesat që jepni
Nëse disponohen, përfshini edhe:
ID-në e projektit që lidhet me kërkesat
Nëse preken kërkesat me qëndrim të të dhënave dhe cilat prej tyre
Përshkrime të prirjeve që po vini re
Sipas llojit të problemit, përfshini:
Gabime: Përqindjen e përafërt të kërkesave që dështojnë ose japin gabime, kodet e përgjigjeve, mesazhet e gabimeve dhe kohën që u desh për të marrë përgjigjen me gabim.
Vonesa: Cilat percentile preken (P50 / P90 / P95 / P99), sa më të larta janë vlerat e tyre krahasuar me nivelin bazë të klientit dhe shembuj kërkesash të ngadalta me datën dhe orën e dërgimit e të marrjes.
Të dyja: Pamje ekrani ose një tabelë me të dhëna për gabimet apo vonesat, si dhe mënyrën se si përcaktuat që shkalla e gabimeve ose vonesat ishin më të larta se sa pritej.
Skenarë të zakonshëm të zgjidhjes së problemeve
Ndodhin skadime kohe, por Gjendja e shërbimit duket normale
Shkaku i mundshëm: kërkesave po u skadon koha përpara se të arrijnë te OpenAI.
Kontrolloni:
Cilësimet e skadimit të kohës së klientit ose proxy-t
Ndryshimet në rrjetin lokal ose balancuesin e ngarkesës
Prania e gabimeve 499 në panelin e gjendjes së shërbimit (këto mund të shfaqen si gabime 5xx në sistemet tuaja).
Vonesa u rrit pa një vendosje
Shkaku i mundshëm: madhësia e tokenëve të daljes ose përdorimi i arsyetimit u rrit dhe/ose trafiku u zhvendos midis niveleve të shërbimit.
Kontrolloni:
Tokenët mesatarë të daljes për kërkesë në panelin e përdorimit (kërkon shkarkimin e të dhënave dhe pjesëtimin e tokenëve të daljes me kërkesat totale).
Përqindëshit e kohës së kërkesës dhe TTFT në panelin e gjendjes së shërbimit.
Modaliteti i shpejtë ose niveli i shkallëzimit duket i ngadaltë
Shkaku i mundshëm: metrikat janë ndërthurur midis niveleve, ndaj trafiku i nivelit standard po fsheh performancën e nivelit me pagesë.
Kontrolloni:
Filtrat janë kufizuar në një nivel dhe model të vetëm.
Krahasimi i shpejtësisë së tokenëve midis niveleve.
Rritje e gabimeve 5XX
Shkaku i mundshëm: dështime kalimtare që prekin një përqindje të vogël të trafikut.
Kontrolloni:
Përqindja e shkallës së gabimeve
Nëse vëllimi i trafikut ndryshoi në të njëjtën kohë
Problemi prek vetëm një projekt
Shkaku i mundshëm: konfigurim ose model përdorimi specifik për projektin.
Kontrolloni:
Filtrim në nivel projekti
Krahasim me projektet e paprekura
Përfundime kryesore
Filtroni sipas modelit, nivelit dhe projektit kur është e rëndësishme, përpara interpretimit të metrikave.
Përdorni përqindëshit, jo mesataret, për analizën e vonesës.
Shkallë të vogla gabimesh janë të pritshme.
Të dhënat që mungojnë zakonisht tregojnë probleme në rrjedhën e sipërme.
Të dhënat e përdorimit mund të ndihmojnë të shpjegojnë pse ndryshoi vonesa; Gjendja e shërbimit tregon kur ndryshoi sjellja.
