OpenAI
Aquesta pàgina s'ha traduït automàticament. Mostra l'article original en anglès.

Resolució de problemes d’errors i latència de l’API

Aquest article explica com utilitzar els taulers d’estat del servei i d’ús per resoldre errors habituals i problemes de latència quan s’utilitza l’API d’OpenAI.

Actualització: 2 hours ago

Enllaços importants

Comenceu amb els valors per defecte adequats

Quan obriu el tauler d'estat del servei, per defecte mostra:

  • Tots els projectes

  • Últims 30 dies

  • Resolució horària

Aquesta vista només és útil per orientar-se. Una resolució de problemes significativa sempre requereix filtrar.

Filtreu abans d'investigar

Filtrar correctament és el pas més important. La majoria de malinterpretacions provenen de barrejar models, nivells o projectes.

Filtreu per model (d'un en un)

Filtreu sempre a un sol model.

Per què:

  • Els problemes en models amb poc trànsit poden quedar ocults pel trànsit de més volum

  • Els models de gran volum poden fer que problemes localitzats semblin globals

  • Els diferents models tenen objectius de rendiment diferents

Nota: seleccionar diversos models els agrega; no alterna entre ells.

Filtreu per nivell de servei

Si utilitzeu més d'un nivell (estàndard, prioritari, d'escalat), filtreu sempre pel nivell que esteu investigant.

Per què:

  • Els nivells tenen característiques de rendiment diferents

  • Els nivells prioritari i d'escalat tenen SLA definits

  • Barrejar nivells oculta el rendiment del nivell de pagament

Això és especialment important per a l'anàlisi de latència.

Filtreu per projecte

Per defecte, l'estat del servei mostra tots els projectes.

Per resoldre problemes, filtreu pels projectes on s'ha observat el problema.

Per què:

  • Un sol projecte de gran volum pot dominar les mètriques.

  • Els projectes afectats més petits poden quedar emmascarats per trànsit no relacionat.

Deixeu seleccionat «Tots els projectes» només si creieu que el problema afecta realment tota l'organització.

Resolució d'errors

Utilitzeu la vista de sol·licituds HTTP

Per investigar errors:

  1. Filtreu per model i nivell de servei.

  2. Obriu la pestanya Sol·licituds HTTP en lloc de la pestanya Temps d'activitat.

Aquesta vista mostra el total de sol·licituds i el recompte d'errors per codi d'estat HTTP. Amplieu fins a la resolució per minut per identificar pics o canvis granulars.

Interpreteu les taxes d'error, no els recomptes

Alguns errors són esperables en qualsevol sistema de producció. Centreu-vos en el percentatge d'errors, no en els totals bruts.

Com més gran sigui el volum total, més gran pot ser el nombre d'errors fins i tot amb una taxa d'error extremadament baixa.

Quan falten errors a l'estat del servei

Si veieu errors del costat del client però cap dada corresponent a l'estat del servei:

  • Probablement les sol·licituds no han arribat a OpenAI.

  • El problema sol estar en fases anteriors (temps d'espera, servidors intermediaris, xarxa).

Això és habitual amb temps d'espera del client agressius.

Resolució de problemes de latència

L'anàlisi de latència és més significativa als nivells prioritari i d'escalat, que tenen SLA definits. El nivell estàndard pot mostrar més variació de latència i no té latència garantida.

Mètriques clau

Per veure cada mètrica, feu clic a la pestanya corresponent:

  • Velocitat dels segments: segments generats per segon; independent de la mida de la indicació.

  • Temps de sol·licitud: durada total de la sol·licitud; molt afectada per la mida de la sortida i el raonament.

  • Temps fins al primer segment (TTFT): temps fins que es genera el primer segment; molt afectat per la mida de la indicació d'entrada no emmagatzemada a la memòria cau i pel raonament.

Reviseu sempre els percentils P50 / P75 / P95. Les mitjanes poden amagar l'impacte en usuaris reals.

6. Correlació de la latència amb l'ús de segments

L'estat del servei mostra quan ha canviat el comportament. Les dades d'ús ajuden a explicar per què.

Al tauler d'ús, feu el següent per assegurar-vos que esteu veient les dades rellevants per a la vostra vista al tauler d'estat del servei:

  • Filtreu pel mateix projecte i model.

  • Agrupeu per nivell de servei, si escau.

  • Centreu-vos en els segments de sortida, que són els que afecten més la latència.

Per a una anàlisi més profunda, exporteu les dades d'activitat i examineu els segments per sol·licitud al llarg del temps.

7. Què cal compartir amb el suport (si cal)

Si contacteu amb el suport, incloeu:

  • ID d'organitzacions afectades (important)

  • Punts finals afectats, com ara Chat Completions o Responses (important)

  • Models afectats (important)

  • Si això és al nivell d'escalat o prioritari (important)

  • Intervals de temps amb zona horària per a latència o errors (important)

  • x-request-id o X-Client-Request-Id rellevants, si estan disponibles

  • Marques de temps amb zona horària, o almenys la data, per a les sol·licituds que proporcioneu

Si està disponible, incloeu també:

  • ID del projecte relacionat amb les sol·licituds

  • Si les sol·licituds d'ubicació de les dades estan afectades i quines

  • Descripcions de les tendències que esteu veient

Per al tipus de problema, incloeu:

  • Errors: percentatge aproximat de sol·licituds amb error o fallides, codis de resposta, missatges d'error i quant de temps s'ha trigat a rebre la resposta d'error.

  • Latència: quins percentils estan afectats (P50 / P90 / P95 / P99), fins a quin punt són alts en comparació amb la línia de base del client i exemples de sol·licituds lentes amb marques de temps d'enviament i recepció.

  • Tots dos: captures de pantalla o una taula de dades d'errors o latència, i també com heu determinat que les taxes d'error o la latència eren més altes del previst.

Escenaris habituals de resolució de problemes

Es produeixen temps d'espera però l'estat del servei sembla normal

Causa possible: les sol·licituds esgoten el temps d'espera abans d'arribar a OpenAI.

Comproveu:

  • Configuració del temps d'espera del client o del servidor intermediari

  • Canvis a la xarxa local o al balancejador de càrrega

  • Presència d'errors 499 al tauler d'estat del servei (poden aparèixer com a errors 5xx als vostres propis sistemes).

La latència ha augmentat sense cap desplegament

Causa possible: ha augmentat la mida dels segments de sortida o l'ús del raonament, i/o el trànsit s'ha desplaçat entre nivells de servei.

Comproveu:

  • Segments de sortida mitjans per sol·licitud al tauler d'ús (cal baixar les dades i dividir els segments de sortida pel total de sol·licituds).

  • Percentils de temps de sol·licitud i TTFT al tauler d'estat del servei.

El nivell prioritari o d'escalat sembla lent

Causa possible: les mètriques es barregen entre nivells, de manera que el trànsit del nivell estàndard emmascara el rendiment del nivell de pagament.

Comproveu:

  • Els filtres estan restringits a un sol nivell i model.

  • Comparació de la velocitat dels segments entre nivells.

Augment dels errors 5XX

Causa probable: errors transitoris que afecten un petit percentatge del trànsit.

Comproveu:

  • Percentatge de taxa d'errors

  • Si el volum de trànsit ha canviat alhora

El problema només afecta un projecte

Causa probable: configuració o patró d'ús específic del projecte.

Comproveu:

  • Filtratge a nivell de projecte

  • Comparació amb projectes no afectats

Conclusions finals

  • Filtreu per model, nivell i projecte, si escau, abans d'interpretar les mètriques.

  • Utilitzeu percentils, no mitjanes, per a l'anàlisi de latència.

  • Les taxes d'error petites són esperables.

  • La manca de dades normalment indica problemes en fases anteriors.

  • Les dades d'ús poden ajudar a explicar per què ha canviat la latència; l'estat del servei mostra quan ha canviat el comportament.

T'ha estat útil aquest article?