Enllaços importants
Tauler d'estat del servei (actualment només disponible per a clients de l'API Enterprise)
Comenceu amb els valors per defecte adequats
Quan obriu el tauler d'estat del servei, per defecte mostra:
Tots els projectes
Últims 30 dies
Resolució horària
Aquesta vista només és útil per orientar-se. Una resolució de problemes significativa sempre requereix filtrar.
Filtreu abans d'investigar
Filtrar correctament és el pas més important. La majoria de malinterpretacions provenen de barrejar models, nivells o projectes.
Filtreu per model (d'un en un)
Filtreu sempre a un sol model.
Per què:
Els problemes en models amb poc trànsit poden quedar ocults pel trànsit de més volum
Els models de gran volum poden fer que problemes localitzats semblin globals
Els diferents models tenen objectius de rendiment diferents
Nota: seleccionar diversos models els agrega; no alterna entre ells.
Filtreu per nivell de servei
Si utilitzeu més d'un nivell (estàndard, mode ràpid —abans, processament prioritari— o nivell d'escalat), filtreu sempre pel nivell que investigueu.
Per què:
Els nivells tenen característiques de rendiment diferents
El mode ràpid i el nivell d'escalat tenen SLA definits
Barrejar nivells oculta el rendiment dels nivells de pagament
Això és especialment important per analitzar la latència.
En els models existents, el trànsit del mode ràpid encara apareix com a prioritari al tauler d'ús.
Filtreu per projecte
Per defecte, l'estat del servei mostra tots els projectes.
Per resoldre problemes, filtreu pels projectes on s'ha observat el problema.
Per què:
Un sol projecte de gran volum pot dominar les mètriques.
Els projectes afectats més petits poden quedar emmascarats per trànsit no relacionat.
Deixeu seleccionat «Tots els projectes» només si creieu que el problema afecta realment tota l'organització.
Resolució d'errors
Utilitzeu la vista de sol·licituds HTTP
Per investigar errors:
Filtreu per model i nivell de servei.
Obriu la pestanya Sol·licituds HTTP en lloc de la pestanya Temps d'activitat.
Aquesta vista mostra el total de sol·licituds i el recompte d'errors per codi d'estat HTTP. Amplieu fins a la resolució per minut per identificar pics o canvis granulars.
Interpreteu les taxes d'error, no els recomptes
Alguns errors són esperables en qualsevol sistema de producció. Centreu-vos en el percentatge d'errors, no en els totals bruts.
Com més gran sigui el volum total, més gran pot ser el nombre d'errors fins i tot amb una taxa d'error extremadament baixa.
Quan falten errors a l'estat del servei
Si veieu errors del costat del client però cap dada corresponent a l'estat del servei:
Probablement les sol·licituds no han arribat a OpenAI.
El problema sol estar en fases anteriors (temps d'espera, servidors intermediaris, xarxa).
Això és habitual amb temps d'espera del client agressius.
Resolució de problemes de latència
L'anàlisi de la latència és més significativa amb el mode ràpid i el nivell d'escalat, que tenen SLA definits. El nivell estàndard pot presentar més variacions de latència i no ofereix cap latència garantida.
Mètriques clau
Per veure cada mètrica, feu clic a la pestanya corresponent:
Velocitat dels segments: segments generats per segon; independent de la mida de la indicació.
Temps de sol·licitud: durada total de la sol·licitud; molt afectada per la mida de la sortida i el raonament.
Temps fins al primer segment (TTFT): temps fins que es genera el primer segment; molt afectat per la mida de la indicació d'entrada no emmagatzemada a la memòria cau i pel raonament.
Reviseu sempre els percentils P50 / P75 / P95. Les mitjanes poden amagar l'impacte en usuaris reals.
6. Correlació de la latència amb l'ús de segments
L'estat del servei mostra quan ha canviat el comportament. Les dades d'ús ajuden a explicar per què.
Al tauler d'ús, feu el següent per assegurar-vos que esteu veient les dades rellevants per a la vostra vista al tauler d'estat del servei:
Filtreu pel mateix projecte i model.
Agrupeu per nivell de servei, si escau.
Centreu-vos en els segments de sortida, que són els que afecten més la latència.
Per a una anàlisi més profunda, exporteu les dades d'activitat i examineu els segments per sol·licitud al llarg del temps.
7. Què cal facilitar al servei d'assistència (si cal)
Si contacteu amb el servei d'assistència, incloeu:
ID de les organitzacions afectades (important)
Endpoints afectats, com ara Chat Completions o Responses (important)
Models afectats (important)
Si el problema es produeix en el mode ràpid o el nivell d'escalat (important)
Intervals de temps amb la zona horària per a la latència o els errors (important)
Els x-request-id o X-Client-Request-Id rellevants, si estan disponibles
Marques de temps amb la zona horària o, com a mínim, la data de les sol·licituds que faciliteu
Si està disponible, incloeu també:
ID del projecte relacionat amb les sol·licituds
Si les sol·licituds d'ubicació de les dades estan afectades i quines són
Descripcions de les tendències que observeu
Segons el tipus d'incidència, incloeu:
Errors: percentatge aproximat de sol·licituds que fallen o retornen errors, codis de resposta, missatges d'error i temps transcorregut fins a rebre la resposta d'error.
Latència: percentils afectats (P50/P90/P95/P99), fins a quin punt superen el valor de referència del client i exemples de sol·licituds lentes amb les marques de temps d'enviament i recepció.
Tots dos: captures de pantalla o una taula amb dades d'errors o de latència, a més d'una explicació de com heu determinat que les taxes d'error o la latència eren superiors al previst.
Escenaris habituals de resolució de problemes
Es produeixen temps d'espera però l'estat del servei sembla normal
Causa possible: les sol·licituds esgoten el temps d'espera abans d'arribar a OpenAI.
Comproveu:
Configuració del temps d'espera del client o del servidor intermediari
Canvis a la xarxa local o al balancejador de càrrega
Presència d'errors 499 al tauler d'estat del servei (poden aparèixer com a errors 5xx als vostres propis sistemes).
La latència ha augmentat sense cap desplegament
Causa possible: ha augmentat la mida dels segments de sortida o l'ús del raonament, i/o el trànsit s'ha desplaçat entre nivells de servei.
Comproveu:
Segments de sortida mitjans per sol·licitud al tauler d'ús (cal baixar les dades i dividir els segments de sortida pel total de sol·licituds).
Percentils de temps de sol·licitud i TTFT al tauler d'estat del servei.
El mode ràpid o el nivell d'escalat semblen lents
Causa possible: es barregen mètriques de diferents nivells, de manera que el trànsit del nivell estàndard oculta el rendiment dels nivells de pagament.
Comproveu que:
Els filtres es limiten a un sol nivell i model.
Es compara la velocitat dels segments entre nivells.
Augment dels errors 5XX
Causa probable: errors transitoris que afecten un petit percentatge del trànsit.
Comproveu:
Percentatge de taxa d'errors
Si el volum de trànsit ha canviat alhora
El problema només afecta un projecte
Causa probable: configuració o patró d'ús específic del projecte.
Comproveu:
Filtratge a nivell de projecte
Comparació amb projectes no afectats
Conclusions finals
Filtreu per model, nivell i projecte, si escau, abans d'interpretar les mètriques.
Utilitzeu percentils, no mitjanes, per a l'anàlisi de latència.
Les taxes d'error petites són esperables.
La manca de dades normalment indica problemes en fases anteriors.
Les dades d'ús poden ajudar a explicar per què ha canviat la latència; l'estat del servei mostra quan ha canviat el comportament.
