OpenAI
Aquesta pàgina s'ha traduït automàticament. Mostra l'article original en anglès.

Resolució de problemes d’errors i latència de l’API

Aquest article explica com utilitzar els taulers d’estat del servei i d’ús per resoldre errors habituals i problemes de latència quan s’utilitza l’API d’OpenAI.

Actualització: 8 days ago

Enllaços importants

Comenceu amb els valors per defecte adequats

Quan obriu el tauler d'estat del servei, per defecte mostra:

  • Tots els projectes

  • Últims 30 dies

  • Resolució horària

Aquesta vista només és útil per orientar-se. Una resolució de problemes significativa sempre requereix filtrar.

Filtreu abans d'investigar

Filtrar correctament és el pas més important. La majoria de malinterpretacions provenen de barrejar models, nivells o projectes.

Filtreu per model (d'un en un)

Filtreu sempre a un sol model.

Per què:

  • Els problemes en models amb poc trànsit poden quedar ocults pel trànsit de més volum

  • Els models de gran volum poden fer que problemes localitzats semblin globals

  • Els diferents models tenen objectius de rendiment diferents

Nota: seleccionar diversos models els agrega; no alterna entre ells.

Filtreu per nivell de servei

Si utilitzeu més d'un nivell (estàndard, mode ràpid —abans, processament prioritari— o nivell d'escalat), filtreu sempre pel nivell que investigueu.

Per què:

  • Els nivells tenen característiques de rendiment diferents

  • El mode ràpid i el nivell d'escalat tenen SLA definits

  • Barrejar nivells oculta el rendiment dels nivells de pagament

Això és especialment important per analitzar la latència.

En els models existents, el trànsit del mode ràpid encara apareix com a prioritari al tauler d'ús.

Filtreu per projecte

Per defecte, l'estat del servei mostra tots els projectes.

Per resoldre problemes, filtreu pels projectes on s'ha observat el problema.

Per què:

  • Un sol projecte de gran volum pot dominar les mètriques.

  • Els projectes afectats més petits poden quedar emmascarats per trànsit no relacionat.

Deixeu seleccionat «Tots els projectes» només si creieu que el problema afecta realment tota l'organització.

Resolució d'errors

Utilitzeu la vista de sol·licituds HTTP

Per investigar errors:

  1. Filtreu per model i nivell de servei.

  2. Obriu la pestanya Sol·licituds HTTP en lloc de la pestanya Temps d'activitat.

Aquesta vista mostra el total de sol·licituds i el recompte d'errors per codi d'estat HTTP. Amplieu fins a la resolució per minut per identificar pics o canvis granulars.

Interpreteu les taxes d'error, no els recomptes

Alguns errors són esperables en qualsevol sistema de producció. Centreu-vos en el percentatge d'errors, no en els totals bruts.

Com més gran sigui el volum total, més gran pot ser el nombre d'errors fins i tot amb una taxa d'error extremadament baixa.

Quan falten errors a l'estat del servei

Si veieu errors del costat del client però cap dada corresponent a l'estat del servei:

  • Probablement les sol·licituds no han arribat a OpenAI.

  • El problema sol estar en fases anteriors (temps d'espera, servidors intermediaris, xarxa).

Això és habitual amb temps d'espera del client agressius.

Resolució de problemes de latència

L'anàlisi de la latència és més significativa amb el mode ràpid i el nivell d'escalat, que tenen SLA definits. El nivell estàndard pot presentar més variacions de latència i no ofereix cap latència garantida.

Mètriques clau

Per veure cada mètrica, feu clic a la pestanya corresponent:

  • Velocitat dels segments: segments generats per segon; independent de la mida de la indicació.

  • Temps de sol·licitud: durada total de la sol·licitud; molt afectada per la mida de la sortida i el raonament.

  • Temps fins al primer segment (TTFT): temps fins que es genera el primer segment; molt afectat per la mida de la indicació d'entrada no emmagatzemada a la memòria cau i pel raonament.

Reviseu sempre els percentils P50 / P75 / P95. Les mitjanes poden amagar l'impacte en usuaris reals.

6. Correlació de la latència amb l'ús de segments

L'estat del servei mostra quan ha canviat el comportament. Les dades d'ús ajuden a explicar per què.

Al tauler d'ús, feu el següent per assegurar-vos que esteu veient les dades rellevants per a la vostra vista al tauler d'estat del servei:

  • Filtreu pel mateix projecte i model.

  • Agrupeu per nivell de servei, si escau.

  • Centreu-vos en els segments de sortida, que són els que afecten més la latència.

Per a una anàlisi més profunda, exporteu les dades d'activitat i examineu els segments per sol·licitud al llarg del temps.

7. Què cal facilitar al servei d'assistència (si cal)

Si contacteu amb el servei d'assistència, incloeu:

  • ID de les organitzacions afectades (important)

  • Endpoints afectats, com ara Chat Completions o Responses (important)

  • Models afectats (important)

  • Si el problema es produeix en el mode ràpid o el nivell d'escalat (important)

  • Intervals de temps amb la zona horària per a la latència o els errors (important)

  • Els x-request-id o X-Client-Request-Id rellevants, si estan disponibles

  • Marques de temps amb la zona horària o, com a mínim, la data de les sol·licituds que faciliteu

Si està disponible, incloeu també:

  • ID del projecte relacionat amb les sol·licituds

  • Si les sol·licituds d'ubicació de les dades estan afectades i quines són

  • Descripcions de les tendències que observeu

Segons el tipus d'incidència, incloeu:

  • Errors: percentatge aproximat de sol·licituds que fallen o retornen errors, codis de resposta, missatges d'error i temps transcorregut fins a rebre la resposta d'error.

  • Latència: percentils afectats (P50/P90/P95/P99), fins a quin punt superen el valor de referència del client i exemples de sol·licituds lentes amb les marques de temps d'enviament i recepció.

  • Tots dos: captures de pantalla o una taula amb dades d'errors o de latència, a més d'una explicació de com heu determinat que les taxes d'error o la latència eren superiors al previst.

Escenaris habituals de resolució de problemes

Es produeixen temps d'espera però l'estat del servei sembla normal

Causa possible: les sol·licituds esgoten el temps d'espera abans d'arribar a OpenAI.

Comproveu:

  • Configuració del temps d'espera del client o del servidor intermediari

  • Canvis a la xarxa local o al balancejador de càrrega

  • Presència d'errors 499 al tauler d'estat del servei (poden aparèixer com a errors 5xx als vostres propis sistemes).

La latència ha augmentat sense cap desplegament

Causa possible: ha augmentat la mida dels segments de sortida o l'ús del raonament, i/o el trànsit s'ha desplaçat entre nivells de servei.

Comproveu:

  • Segments de sortida mitjans per sol·licitud al tauler d'ús (cal baixar les dades i dividir els segments de sortida pel total de sol·licituds).

  • Percentils de temps de sol·licitud i TTFT al tauler d'estat del servei.

El mode ràpid o el nivell d'escalat semblen lents

Causa possible: es barregen mètriques de diferents nivells, de manera que el trànsit del nivell estàndard oculta el rendiment dels nivells de pagament.

Comproveu que:

  • Els filtres es limiten a un sol nivell i model.

  • Es compara la velocitat dels segments entre nivells.

Augment dels errors 5XX

Causa probable: errors transitoris que afecten un petit percentatge del trànsit.

Comproveu:

  • Percentatge de taxa d'errors

  • Si el volum de trànsit ha canviat alhora

El problema només afecta un projecte

Causa probable: configuració o patró d'ús específic del projecte.

Comproveu:

  • Filtratge a nivell de projecte

  • Comparació amb projectes no afectats

Conclusions finals

  • Filtreu per model, nivell i projecte, si escau, abans d'interpretar les mètriques.

  • Utilitzeu percentils, no mitjanes, per a l'anàlisi de latència.

  • Les taxes d'error petites són esperables.

  • La manca de dades normalment indica problemes en fases anteriors.

  • Les dades d'ús poden ajudar a explicar per què ha canviat la latència; l'estat del servei mostra quan ha canviat el comportament.

T'ha estat útil aquest article?