OpenAI
Kjo faqe u përkthye automatikisht. Shih artikullin origjinal në anglisht.

Zgjidhja e problemeve të gabimeve dhe vonesës së API-së

Ky artikull shpjegon si të përdorni panelet e Shëndetit të Shërbimit dhe Përdorimit për të zgjidhur gabimet e zakonshme dhe problemet e vonesës kur përdorni OpenAI API.

Përditësuar: 4 days ago

Lidhje të rëndësishme

Filloni me parazgjedhjet e duhura

Kur hapni panelin e gjendjes së shërbimit, ai vendoset si parazgjedhje në:

  • Të gjitha projektet

  • 30 ditët e fundit

  • Rezolucion orar

Kjo pamje është e dobishme vetëm për orientim. Zgjidhja kuptimplotë e problemeve kërkon gjithmonë filtrimin.

Filtroni përpara hetimit

Filtrimi i saktë është hapi më i rëndësishëm. Shumica e keqinterpretimeve vijnë nga përzierja e modeleve, niveleve ose projekteve.

Filtroni sipas modelit (një nga një)

Filtroni gjithmonë në një model të vetëm.

Pse:

  • Problemet në modelet me trafik të ulët mund të fshihen nga trafiku me vëllim më të lartë

  • Modelet me vëllim të lartë mund t'i bëjnë problemet lokale të duken globale

  • Modele të ndryshme kanë objektiva të ndryshme performance

Shënim: zgjedhja e disa modeleve i agregon ato—nuk kalon nga njëri te tjetri.

Filtroni sipas nivelit të shërbimit

Nëse përdorni më shumë se një nivel (standard, prioritar, shkallëzimi), filtroni gjithmonë në nivelin që po hetoni.

Pse:

  • Nivelet kanë karakteristika të ndryshme performance

  • Nivelet prioritare dhe të shkallëzimit kanë SLA të përcaktuara

  • Përzierja e niveleve errëson performancën e nivelit me pagesë

Kjo është veçanërisht e rëndësishme për analizën e vonesës.

Filtroni sipas projektit

Si parazgjedhje, Gjendja e shërbimit shfaq të gjitha projektet.

Për zgjidhjen e problemeve, filtroni në projektin/projektet ku u vëzhgua problemi.

Pse:

  • Një projekt i vetëm me vëllim të lartë mund të dominojë metrikat.

  • Projektet më të vogla të prekura mund të maskohen nga trafik i palidhur.

Lëreni të zgjedhur “Të gjitha projektet” vetëm nëse besoni se problemi është vërtet në të gjithë organizatën.

Zgjidhja e problemeve me gabimet

Përdorni pamjen e kërkesave HTTP

Për të hetuar gabimet:

  1. Filtroni sipas modelit dhe nivelit të shërbimit.

  2. Hapni skedën Kërkesat HTTP në vend të skedës Koha aktive.

Kjo pamje tregon kërkesat totale dhe numrin e gabimeve sipas kodit të statusit HTTP. Zmadhoni në rezolucion në nivel minute për të identifikuar rritje ose ndryshime të imëta.

Interpretoni shkallët e gabimeve, jo numërimet

Disa gabime janë të pritshme në çdo sistem prodhimi. Përqendrohuni te përqindja e gabimeve, jo te totalet bruto.

Sa më i madh të jetë vëllimi juaj total, aq më i madh është numri i mundshëm i gabimeve edhe me një shkallë gabimesh jashtëzakonisht të ulët.

Kur gabimet mungojnë nga Gjendja e shërbimit

Nëse shihni gabime në anën e klientit, por jo të dhëna përkatëse në Gjendjen e shërbimit:

  • Kërkesat ka gjasa të mos kenë arritur te OpenAI.

  • Problemi zakonisht është në rrjedhën e sipërme (skadime kohe, proxy, rrjetëzim).

Kjo është e zakonshme me skadime kohe agresive në anën e klientit.

Zgjidhja e problemeve me vonesën

Analiza e vonesës është më kuptimplotë në nivelet prioritare dhe të shkallëzimit, të cilat kanë SLA të përcaktuara. Niveli standard mund të tregojë ndryshime më të mëdha të vonesës dhe nuk ka vonesë të garantuar.

Metrikat kryesore

Për të parë çdo metrikë, klikoni skedën përkatëse:

  • Shpejtësia e tokenëve: Tokenë të gjeneruar për sekondë; e pavarur nga madhësia e kërkesës.

  • Koha e kërkesës: Kohëzgjatja totale e kërkesës; ndikohet shumë nga madhësia e daljes dhe arsyetimi.

  • Koha deri te tokeni i parë (TTFT): Koha derisa gjenerohet tokeni i parë; ndikohet shumë nga madhësia e kërkesës hyrëse të paruajtur në cache dhe arsyetimi.

Rishikoni gjithmonë përqindëshit P50 / P75 / P95. Mesataret mund të fshehin ndikimin te përdoruesit realë.

6. Korrelimi i vonesës me përdorimin e tokenëve

Gjendja e shërbimit tregon kur ndryshoi sjellja. Të dhënat e përdorimit ndihmojnë të shpjegohet pse.

Në panelin e përdorimit, bëni sa më poshtë për t'u siguruar që po shihni të dhënat përkatëse për pamjen tuaj në panelin e gjendjes së shërbimit:

  • Filtroni në të njëjtin projekt dhe model.

  • Gruponi sipas nivelit të shërbimit, nëse zbatohet.

  • Përqendrohuni te tokenët e daljes, të cilët ndikojnë më fort në vonesë.

Për analizë më të thellë, eksportoni të dhënat e aktivitetit dhe shqyrtoni tokenët për kërkesë me kalimin e kohës.

7. Çfarë të ndani me mbështetjen (nëse nevojitet)

Nëse kontaktoni mbështetjen, përfshini:

  • ID-të e organizatave të prekura (e rëndësishme)

  • Pikat fundore të prekura, si Chat Completions ose Responses (e rëndësishme)

  • Modelet e prekura (e rëndësishme)

  • Nëse kjo është në nivel shkallëzimi ose prioritar (e rëndësishme)

  • Intervalet kohore me zonën kohore për vonesë ose gabime (e rëndësishme)

  • x-request-id ose X-Client-Request-Id përkatës, nëse është i disponueshëm

  • Vula kohore me zonën kohore, ose të paktën data, për kërkesat që jepni

Nëse është e disponueshme, përfshini gjithashtu:

  • ID e projektit e lidhur me kërkesat

  • Nëse kërkesat për qëndrimin e të dhënave janë prekur dhe cilat prej tyre

  • Përshkrime të trendeve që po shihni

Për llojin e problemit, përfshini:

  • Gabime: Përqindjen e përafërt të kërkesave që dështojnë ose japin gabim, kodet e përgjigjes, mesazhet e gabimeve dhe sa kohë u desh për të marrë përgjigjen e gabimit.

  • Vonesë: Cilët përqindësh janë prekur (P50 / P90 / P95 / P99), sa të lartë janë krahasuar me bazën e klientit dhe shembuj të kërkesave të ngadalta me vulat kohore të dërgimit dhe marrjes.

  • Të dyja: Pamje ekrani ose një tabelë me të dhëna gabimesh ose vonese, plus si përcaktuat se shkallët e gabimeve ose vonesa ishin më të larta se sa pritej.

Skenarë të zakonshëm të zgjidhjes së problemeve

Ndodhin skadime kohe, por Gjendja e shërbimit duket normale

Shkaku i mundshëm: kërkesave po u skadon koha përpara se të arrijnë te OpenAI.

Kontrolloni:

  • Cilësimet e skadimit të kohës së klientit ose proxy-t

  • Ndryshimet në rrjetin lokal ose balancuesin e ngarkesës

  • Prania e gabimeve 499 në panelin e gjendjes së shërbimit (këto mund të shfaqen si gabime 5xx në sistemet tuaja).

Vonesa u rrit pa një vendosje

Shkaku i mundshëm: madhësia e tokenëve të daljes ose përdorimi i arsyetimit u rrit dhe/ose trafiku u zhvendos midis niveleve të shërbimit.

Kontrolloni:

  • Tokenët mesatarë të daljes për kërkesë në panelin e përdorimit (kërkon shkarkimin e të dhënave dhe pjesëtimin e tokenëve të daljes me kërkesat totale).

  • Përqindëshit e kohës së kërkesës dhe TTFT në panelin e gjendjes së shërbimit.

Niveli prioritar ose niveli shkallëzimi duket i ngadaltë

Shkaku i mundshëm: metrikat janë përzier midis niveleve, që do të thotë se trafiku i nivelit standard po maskon performancën e nivelit me pagesë.

Kontrolloni:

  • Filtrat janë kufizuar në një nivel dhe model të vetëm.

  • Krahasimi i shpejtësisë së tokenëve midis niveleve.

Rritje e gabimeve 5XX

Shkaku i mundshëm: dështime kalimtare që prekin një përqindje të vogël të trafikut.

Kontrolloni:

  • Përqindja e shkallës së gabimeve

  • Nëse vëllimi i trafikut ndryshoi në të njëjtën kohë

Problemi prek vetëm një projekt

Shkaku i mundshëm: konfigurim ose model përdorimi specifik për projektin.

Kontrolloni:

  • Filtrim në nivel projekti

  • Krahasim me projektet e paprekura

Përfundime kryesore

  • Filtroni sipas modelit, nivelit dhe projektit kur është e rëndësishme, përpara interpretimit të metrikave.

  • Përdorni përqindëshit, jo mesataret, për analizën e vonesës.

  • Shkallë të vogla gabimesh janë të pritshme.

  • Të dhënat që mungojnë zakonisht tregojnë probleme në rrjedhën e sipërme.

  • Të dhënat e përdorimit mund të ndihmojnë të shpjegojnë pse ndryshoi vonesa; Gjendja e shërbimit tregon kur ndryshoi sjellja.

A ishte i dobishëm ky artikull?