OpenAI
Aquesta pàgina s'ha traduït automàticament. Mostra l'article original en anglès.

Resolució de problemes d’errors i latència de l’API

Aquest article explica com utilitzar els taulers d’estat del servei i d’ús per resoldre errors habituals i problemes de latència quan s’utilitza l’API d’OpenAI.

Actualització: 16 days ago

Enllaços importants

Comenceu amb els valors per defecte adequats

Quan obriu el tauler d'estat del servei, per defecte mostra:

  • Tots els projectes

  • Últims 30 dies

  • Resolució horària

Aquesta vista només és útil per orientar-se. Una resolució de problemes significativa sempre requereix filtrar.

Filtreu abans d'investigar

Filtrar correctament és el pas més important. La majoria de malinterpretacions provenen de barrejar models, nivells o projectes.

Filtreu per model (d'un en un)

Filtreu sempre a un sol model.

Per què:

  • Els problemes en models amb poc trànsit poden quedar ocults pel trànsit de més volum

  • Els models de gran volum poden fer que problemes localitzats semblin globals

  • Els diferents models tenen objectius de rendiment diferents

Nota: seleccionar diversos models els agrega; no alterna entre ells.

Filtreu per nivell de servei

Si utilitzeu més d'un nivell (estàndard, mode ràpid —abans, processament prioritari— o nivell d'escalat), filtreu sempre pel nivell que investigueu.

Per què:

  • Els nivells tenen característiques de rendiment diferents

  • El mode ràpid i el nivell d'escalat tenen SLA definits

  • Barrejar nivells oculta el rendiment dels nivells de pagament

Això és especialment important per analitzar la latència.

En els models existents, el trànsit del mode ràpid encara apareix com a prioritari al tauler d'ús.

Filtreu per projecte

Per defecte, l'estat del servei mostra tots els projectes.

Per resoldre problemes, filtreu pels projectes on s'ha observat el problema.

Per què:

  • Un sol projecte de gran volum pot dominar les mètriques.

  • Els projectes afectats més petits poden quedar emmascarats per trànsit no relacionat.

Deixeu seleccionat «Tots els projectes» només si creieu que el problema afecta realment tota l'organització.

Resolució d'errors

Utilitzeu la vista de sol·licituds HTTP

Per investigar errors:

  1. Filtreu per model i nivell de servei.

  2. Obriu la pestanya Sol·licituds HTTP en lloc de la pestanya Temps d'activitat.

Aquesta vista mostra el total de sol·licituds i el recompte d'errors per codi d'estat HTTP. Amplieu fins a la resolució per minut per identificar pics o canvis granulars.

Interpreteu les taxes d'error, no els recomptes

Alguns errors són esperables en qualsevol sistema de producció. Centreu-vos en el percentatge d'errors, no en els totals bruts.

Com més gran sigui el volum total, més gran pot ser el nombre d'errors fins i tot amb una taxa d'error extremadament baixa.

Quan falten errors a l'estat del servei

Si veieu errors del costat del client però cap dada corresponent a l'estat del servei:

  • Probablement les sol·licituds no han arribat a OpenAI.

  • El problema sol estar en fases anteriors (temps d'espera, servidors intermediaris, xarxa).

Això és habitual amb temps d'espera del client agressius.

Resolució de problemes de latència

L'anàlisi de la latència és més significativa amb el mode ràpid i el nivell d'escalat, que tenen SLA definits. El nivell estàndard pot presentar més variacions de latència i no ofereix cap latència garantida.

Mètriques clau

Per veure cada mètrica, feu clic a la pestanya corresponent:

  • Velocitat dels segments: segments generats per segon; independent de la mida de la indicació.

  • Temps de sol·licitud: durada total de la sol·licitud; molt afectada per la mida de la sortida i el raonament.

  • Temps fins al primer segment (TTFT): temps fins que es genera el primer segment; molt afectat per la mida de la indicació d'entrada no emmagatzemada a la memòria cau i pel raonament.

Reviseu sempre els percentils P50 / P75 / P95. Les mitjanes poden amagar l'impacte en usuaris reals.

Correlació entre la latència i l'ús de segments

L'estat del servei mostra quan ha canviat el comportament. Les dades d'ús ajuden a explicar per què.

Al tauler d'ús, segueix aquests passos per assegurar-te que consultes les dades corresponents a la vista del tauler d'estat del servei:

  • Filtra pel mateix projecte i model.

  • Agrupa per nivell de servei, si escau.

  • Centra't en els segments de sortida, que són els que més afecten la latència.

Per fer una anàlisi més detallada, exporta les dades d'activitat i examina els segments per sol·licitud al llarg del temps.

Què cal compartir amb el servei d'assistència (si cal)

Si contactes amb el servei d'assistència, inclou-hi:

  • Els identificadors de les organitzacions afectades (important)

  • Els punts de connexió afectats, com ara Chat Completions o Responses (important)

  • Els models afectats (important)

  • Si el problema es produeix en el mode ràpid o en el nivell d'escalat (important)

  • Els intervals de temps en què es produeixen problemes de latència o errors, amb el fus horari (important)

  • Els valors x-request-id o X-Client-Request-Id pertinents, si estan disponibles

  • Les marques de temps amb el fus horari, o com a mínim la data, de les sol·licituds que facilitis

Si en disposes, inclou-hi també:

  • L'identificador del projecte relacionat amb les sol·licituds

  • Si hi ha sol·licituds amb requisits d'ubicació de les dades afectades i quines són

  • Descripcions de les tendències que observes

Segons el tipus de problema, inclou-hi:

  • Errors: El percentatge aproximat de sol·licituds que fallen o retornen errors, els codis de resposta, els missatges d'error i el temps que s'ha trigat a rebre la resposta d'error.

  • Latència: Quins percentils estan afectats (P50 / P90 / P95 / P99), quant superen els valors de referència del client i exemples de sol·licituds lentes amb les marques de temps d'enviament i recepció.

  • Tots dos: Captures de pantalla o una taula de dades d'errors o de latència, i com has determinat que les taxes d'error o la latència eren superiors als valors esperats.

Escenaris habituals de resolució de problemes

Es produeixen temps d'espera però l'estat del servei sembla normal

Causa possible: les sol·licituds esgoten el temps d'espera abans d'arribar a OpenAI.

Comproveu:

  • Configuració del temps d'espera del client o del servidor intermediari

  • Canvis a la xarxa local o al balancejador de càrrega

  • Presència d'errors 499 al tauler d'estat del servei (poden aparèixer com a errors 5xx als vostres propis sistemes).

La latència ha augmentat sense cap desplegament

Causa possible: ha augmentat la mida dels segments de sortida o l'ús del raonament, i/o el trànsit s'ha desplaçat entre nivells de servei.

Comproveu:

  • Segments de sortida mitjans per sol·licitud al tauler d'ús (cal baixar les dades i dividir els segments de sortida pel total de sol·licituds).

  • Percentils de temps de sol·licitud i TTFT al tauler d'estat del servei.

El mode ràpid o el nivell d'escalat semblen lents

Causa possible: es barregen mètriques de diferents nivells, de manera que el trànsit del nivell estàndard oculta el rendiment dels nivells de pagament.

Comproveu que:

  • Els filtres es limiten a un sol nivell i model.

  • Es compara la velocitat dels segments entre nivells.

Augment dels errors 5XX

Causa probable: errors transitoris que afecten un petit percentatge del trànsit.

Comproveu:

  • Percentatge de taxa d'errors

  • Si el volum de trànsit ha canviat alhora

El problema només afecta un projecte

Causa probable: configuració o patró d'ús específic del projecte.

Comproveu:

  • Filtratge a nivell de projecte

  • Comparació amb projectes no afectats

Conclusions finals

  • Filtreu per model, nivell i projecte, si escau, abans d'interpretar les mètriques.

  • Utilitzeu percentils, no mitjanes, per a l'anàlisi de latència.

  • Les taxes d'error petites són esperables.

  • La manca de dades normalment indica problemes en fases anteriors.

  • Les dades d'ús poden ajudar a explicar per què ha canviat la latència; l'estat del servei mostra quan ha canviat el comportament.

T'ha estat útil aquest article?