Lidhje të rëndësishme
Paneli i gjendjes së shërbimit (aktualisht i disponueshëm vetëm për klientët Enterprise API)
Filloni me parazgjedhjet e duhura
Kur hapni panelin e gjendjes së shërbimit, ai vendoset si parazgjedhje në:
Të gjitha projektet
30 ditët e fundit
Rezolucion orar
Kjo pamje është e dobishme vetëm për orientim. Zgjidhja kuptimplotë e problemeve kërkon gjithmonë filtrimin.
Filtroni përpara hetimit
Filtrimi i saktë është hapi më i rëndësishëm. Shumica e keqinterpretimeve vijnë nga përzierja e modeleve, niveleve ose projekteve.
Filtroni sipas modelit (një nga një)
Filtroni gjithmonë në një model të vetëm.
Pse:
Problemet në modelet me trafik të ulët mund të fshihen nga trafiku me vëllim më të lartë
Modelet me vëllim të lartë mund t'i bëjnë problemet lokale të duken globale
Modele të ndryshme kanë objektiva të ndryshme performance
Shënim: zgjedhja e disa modeleve i agregon ato—nuk kalon nga njëri te tjetri.
Filtroni sipas nivelit të shërbimit
Nëse përdorni më shumë se një nivel (standard, prioritar, shkallëzimi), filtroni gjithmonë në nivelin që po hetoni.
Pse:
Nivelet kanë karakteristika të ndryshme performance
Nivelet prioritare dhe të shkallëzimit kanë SLA të përcaktuara
Përzierja e niveleve errëson performancën e nivelit me pagesë
Kjo është veçanërisht e rëndësishme për analizën e vonesës.
Filtroni sipas projektit
Si parazgjedhje, Gjendja e shërbimit shfaq të gjitha projektet.
Për zgjidhjen e problemeve, filtroni në projektin/projektet ku u vëzhgua problemi.
Pse:
Një projekt i vetëm me vëllim të lartë mund të dominojë metrikat.
Projektet më të vogla të prekura mund të maskohen nga trafik i palidhur.
Lëreni të zgjedhur “Të gjitha projektet” vetëm nëse besoni se problemi është vërtet në të gjithë organizatën.
Zgjidhja e problemeve me gabimet
Përdorni pamjen e kërkesave HTTP
Për të hetuar gabimet:
Filtroni sipas modelit dhe nivelit të shërbimit.
Hapni skedën Kërkesat HTTP në vend të skedës Koha aktive.
Kjo pamje tregon kërkesat totale dhe numrin e gabimeve sipas kodit të statusit HTTP. Zmadhoni në rezolucion në nivel minute për të identifikuar rritje ose ndryshime të imëta.
Interpretoni shkallët e gabimeve, jo numërimet
Disa gabime janë të pritshme në çdo sistem prodhimi. Përqendrohuni te përqindja e gabimeve, jo te totalet bruto.
Sa më i madh të jetë vëllimi juaj total, aq më i madh është numri i mundshëm i gabimeve edhe me një shkallë gabimesh jashtëzakonisht të ulët.
Kur gabimet mungojnë nga Gjendja e shërbimit
Nëse shihni gabime në anën e klientit, por jo të dhëna përkatëse në Gjendjen e shërbimit:
Kërkesat ka gjasa të mos kenë arritur te OpenAI.
Problemi zakonisht është në rrjedhën e sipërme (skadime kohe, proxy, rrjetëzim).
Kjo është e zakonshme me skadime kohe agresive në anën e klientit.
Zgjidhja e problemeve me vonesën
Analiza e vonesës është më kuptimplotë në nivelet prioritare dhe të shkallëzimit, të cilat kanë SLA të përcaktuara. Niveli standard mund të tregojë ndryshime më të mëdha të vonesës dhe nuk ka vonesë të garantuar.
Metrikat kryesore
Për të parë çdo metrikë, klikoni skedën përkatëse:
Shpejtësia e tokenëve: Tokenë të gjeneruar për sekondë; e pavarur nga madhësia e kërkesës.
Koha e kërkesës: Kohëzgjatja totale e kërkesës; ndikohet shumë nga madhësia e daljes dhe arsyetimi.
Koha deri te tokeni i parë (TTFT): Koha derisa gjenerohet tokeni i parë; ndikohet shumë nga madhësia e kërkesës hyrëse të paruajtur në cache dhe arsyetimi.
Rishikoni gjithmonë përqindëshit P50 / P75 / P95. Mesataret mund të fshehin ndikimin te përdoruesit realë.
6. Korrelimi i vonesës me përdorimin e tokenëve
Gjendja e shërbimit tregon kur ndryshoi sjellja. Të dhënat e përdorimit ndihmojnë të shpjegohet pse.
Në panelin e përdorimit, bëni sa më poshtë për t'u siguruar që po shihni të dhënat përkatëse për pamjen tuaj në panelin e gjendjes së shërbimit:
Filtroni në të njëjtin projekt dhe model.
Gruponi sipas nivelit të shërbimit, nëse zbatohet.
Përqendrohuni te tokenët e daljes, të cilët ndikojnë më fort në vonesë.
Për analizë më të thellë, eksportoni të dhënat e aktivitetit dhe shqyrtoni tokenët për kërkesë me kalimin e kohës.
7. Çfarë të ndani me mbështetjen (nëse nevojitet)
Nëse kontaktoni mbështetjen, përfshini:
ID-të e organizatave të prekura (e rëndësishme)
Pikat fundore të prekura, si Chat Completions ose Responses (e rëndësishme)
Modelet e prekura (e rëndësishme)
Nëse kjo është në nivel shkallëzimi ose prioritar (e rëndësishme)
Intervalet kohore me zonën kohore për vonesë ose gabime (e rëndësishme)
x-request-id ose X-Client-Request-Id përkatës, nëse është i disponueshëm
Vula kohore me zonën kohore, ose të paktën data, për kërkesat që jepni
Nëse është e disponueshme, përfshini gjithashtu:
ID e projektit e lidhur me kërkesat
Nëse kërkesat për qëndrimin e të dhënave janë prekur dhe cilat prej tyre
Përshkrime të trendeve që po shihni
Për llojin e problemit, përfshini:
Gabime: Përqindjen e përafërt të kërkesave që dështojnë ose japin gabim, kodet e përgjigjes, mesazhet e gabimeve dhe sa kohë u desh për të marrë përgjigjen e gabimit.
Vonesë: Cilët përqindësh janë prekur (P50 / P90 / P95 / P99), sa të lartë janë krahasuar me bazën e klientit dhe shembuj të kërkesave të ngadalta me vulat kohore të dërgimit dhe marrjes.
Të dyja: Pamje ekrani ose një tabelë me të dhëna gabimesh ose vonese, plus si përcaktuat se shkallët e gabimeve ose vonesa ishin më të larta se sa pritej.
Skenarë të zakonshëm të zgjidhjes së problemeve
Ndodhin skadime kohe, por Gjendja e shërbimit duket normale
Shkaku i mundshëm: kërkesave po u skadon koha përpara se të arrijnë te OpenAI.
Kontrolloni:
Cilësimet e skadimit të kohës së klientit ose proxy-t
Ndryshimet në rrjetin lokal ose balancuesin e ngarkesës
Prania e gabimeve 499 në panelin e gjendjes së shërbimit (këto mund të shfaqen si gabime 5xx në sistemet tuaja).
Vonesa u rrit pa një vendosje
Shkaku i mundshëm: madhësia e tokenëve të daljes ose përdorimi i arsyetimit u rrit dhe/ose trafiku u zhvendos midis niveleve të shërbimit.
Kontrolloni:
Tokenët mesatarë të daljes për kërkesë në panelin e përdorimit (kërkon shkarkimin e të dhënave dhe pjesëtimin e tokenëve të daljes me kërkesat totale).
Përqindëshit e kohës së kërkesës dhe TTFT në panelin e gjendjes së shërbimit.
Niveli prioritar ose niveli shkallëzimi duket i ngadaltë
Shkaku i mundshëm: metrikat janë përzier midis niveleve, që do të thotë se trafiku i nivelit standard po maskon performancën e nivelit me pagesë.
Kontrolloni:
Filtrat janë kufizuar në një nivel dhe model të vetëm.
Krahasimi i shpejtësisë së tokenëve midis niveleve.
Rritje e gabimeve 5XX
Shkaku i mundshëm: dështime kalimtare që prekin një përqindje të vogël të trafikut.
Kontrolloni:
Përqindja e shkallës së gabimeve
Nëse vëllimi i trafikut ndryshoi në të njëjtën kohë
Problemi prek vetëm një projekt
Shkaku i mundshëm: konfigurim ose model përdorimi specifik për projektin.
Kontrolloni:
Filtrim në nivel projekti
Krahasim me projektet e paprekura
Përfundime kryesore
Filtroni sipas modelit, nivelit dhe projektit kur është e rëndësishme, përpara interpretimit të metrikave.
Përdorni përqindëshit, jo mesataret, për analizën e vonesës.
Shkallë të vogla gabimesh janë të pritshme.
Të dhënat që mungojnë zakonisht tregojnë probleme në rrjedhën e sipërme.
Të dhënat e përdorimit mund të ndihmojnë të shpjegojnë pse ndryshoi vonesa; Gjendja e shërbimit tregon kur ndryshoi sjellja.
