महत्त्वाचे दुवे
सेवा आरोग्य डॅशबोर्ड (सध्या फक्त Enterprise API ग्राहकांसाठी उपलब्ध)
योग्य डीफॉल्टपासून सुरुवात करा
तुम्ही सेवा आरोग्य डॅशबोर्ड उघडता तेव्हा, तो डीफॉल्टने हे दाखवतो:
सर्व प्रकल्प
मागील 30 दिवस
तासागणिक रिझोल्यूशन
हे दृश्य फक्त दिशा समजण्यासाठी उपयुक्त आहे. अर्थपूर्ण ट्रबलशूटिंगसाठी नेहमी फिल्टरिंग आवश्यक असते.
तपासापूर्वी फिल्टर करा
योग्य फिल्टरिंग ही सर्वात महत्त्वाची पायरी आहे. बहुतेक चुकीचे अर्थ लावणे मॉडेल, टियर किंवा प्रकल्प मिसळल्यामुळे होते.
मॉडेलनुसार फिल्टर करा (एका वेळी एक)
नेहमी एकाच मॉडेलवर फिल्टर करा.
का:
कमी-ट्रॅफिक मॉडेलवरील समस्या जास्त-प्रमाणाच्या ट्रॅफिकमुळे लपल्या जाऊ शकतात
जास्त-प्रमाणाची मॉडेल स्थानिक समस्या जागतिक वाटू शकतात
वेगवेगळ्या मॉडेलची कार्यप्रदर्शन उद्दिष्टे वेगवेगळी असतात
टीप: अनेक मॉडेल निवडल्यास ती एकत्रित केली जातात—त्यांच्यात स्विच होत नाही.
सेवा टियरनुसार फिल्टर करा
तुम्ही एकापेक्षा जास्त टियर वापरत असल्यास (मानक, फास्ट मोड (पूर्वी प्राधान्य प्रक्रिया), स्केल टियर), तुम्ही तपासत असलेल्या टियरपुरताच डेटा नेहमी फिल्टर करा.
कारण:
प्रत्येक टियरच्या कामगिरीची वैशिष्ट्ये वेगवेगळी असतात
फास्ट मोड आणि स्केल टियरसाठी निर्धारित SLA आहेत
टियर एकत्र केल्याने सशुल्क टियरची कामगिरी अस्पष्ट होते
विलंबाच्या विश्लेषणासाठी हे विशेषतः महत्त्वाचे आहे.
सध्याच्या मॉडेलसाठी, फास्ट मोडची वाहतूक वापर डॅशबोर्डमध्ये अजूनही प्राधान्य म्हणून दिसते.
प्रकल्पानुसार फिल्टर करा
डीफॉल्टने, सेवा आरोग्य सर्व प्रकल्प दाखवते.
ट्रबलशूटिंगसाठी, ज्या प्रकल्पांमध्ये समस्या दिसली त्यावर फिल्टर करा.
का:
एकच जास्त-प्रमाणाचा प्रकल्प मेट्रिक्सवर वर्चस्व गाजवू शकतो.
लहान प्रभावित प्रकल्प असंबंधित ट्रॅफिकमुळे झाकले जाऊ शकतात.
समस्या खरोखर संपूर्ण संस्थेत आहे असे तुम्हाला वाटत असल्यासच "सर्व प्रकल्प" निवडलेले ठेवा.
त्रुटींचे ट्रबलशूटिंग
HTTP विनंत्या दृश्य वापरा
त्रुटी तपासण्यासाठी:
मॉडेल आणि सेवा टियरनुसार फिल्टर करा.
अपटाइम टॅबऐवजी HTTP विनंत्या टॅब उघडा.
हे दृश्य HTTP स्थिती कोडनुसार एकूण विनंत्या आणि त्रुटींची संख्या दाखवते. सूक्ष्म वाढी किंवा बदल ओळखण्यासाठी मिनिट-स्तर रिझोल्यूशनपर्यंत झूम करा.
संख्या नव्हे, त्रुटी दरांचा अर्थ लावा
कोणत्याही प्रॉडक्शन प्रणालीमध्ये काही त्रुटी अपेक्षित असतात. कच्च्या एकूण संख्यांवर नव्हे, तर त्रुटी टक्केवारीवर लक्ष केंद्रित करा.
तुमचे एकूण प्रमाण जितके मोठे, तितका अत्यंत कमी त्रुटी दर असतानाही संभाव्य त्रुटींची संख्या मोठी असू शकते.
सेवा आरोग्यात त्रुटी दिसत नसल्यास
तुम्हाला क्लायंट-साइड त्रुटी दिसत असतील पण सेवा आरोग्यात संबंधित डेटा नसेल तर:
विनंत्या कदाचित OpenAI पर्यंत पोहोचल्या नाहीत.
समस्या सहसा अपस्ट्रीम असते (टाइमआउट, प्रॉक्सी, नेटवर्किंग).
आक्रमक क्लायंट-साइड टाइमआउटसह हे सामान्य आहे.
विलंबाशी संबंधित समस्यांचे निवारण
निर्धारित SLA असलेल्या फास्ट मोड आणि स्केल टियरमध्ये विलंबाचे विश्लेषण सर्वाधिक उपयुक्त ठरते. मानक टियरमध्ये विलंबात अधिक चढ-उतार दिसू शकतात आणि विलंबाची हमी नसते.
मुख्य मेट्रिक्स
प्रत्येक मेट्रिक पाहण्यासाठी, संबंधित टॅबवर क्लिक करा:
टोकन वेग: प्रति सेकंद तयार होणारे टोकन; प्रॉम्प्टच्या आकारापासून स्वतंत्र.
विनंती वेळ: एकूण विनंती कालावधी; आउटपुट आकार आणि रीझनिंगचा मोठा परिणाम होतो.
पहिल्या टोकनपर्यंतचा वेळ (TTFT): पहिले टोकन तयार होईपर्यंतचा वेळ; कॅश न केलेल्या इनपुट प्रॉम्प्ट आकार आणि रीझनिंगचा मोठा परिणाम होतो.
नेहमी P50 / P75 / P95 पर्सेंटाइल्स तपासा. सरासरी खऱ्या वापरकर्ता-प्रभावाला लपवू शकतात.
6. विलंबता आणि टोकन वापर यांचा सहसंबंध लावणे
सेवा आरोग्य वर्तन केव्हा बदलले हे दाखवते. वापर डेटा का हे स्पष्ट करण्यात मदत करतो.
वापर डॅशबोर्डमध्ये, सेवा आरोग्य डॅशबोर्डमधील तुमच्या दृश्याशी संबंधित डेटा तुम्ही पाहत आहात याची खात्री करण्यासाठी पुढील गोष्टी करा:
त्याच प्रकल्प आणि मॉडेलवर फिल्टर करा.
लागू असल्यास, सेवा टियरनुसार गटबद्ध करा.
विलंबतेवर सर्वाधिक परिणाम करणाऱ्या आउटपुट टोकनवर लक्ष केंद्रित करा.
सखोल विश्लेषणासाठी, क्रियाकलाप डेटा निर्यात करा आणि काळानुसार प्रत्येक विनंतीमागील टोकन तपासा.
7. आवश्यक असल्यास सहाय्य विभागाला कोणती माहिती द्यावी
तुम्ही सहाय्य विभागाशी संपर्क साधल्यास, पुढील माहिती द्या:
प्रभावित संस्थांचे आयडी (महत्त्वाचे)
Chat Completions किंवा Responses यांसारखे प्रभावित एंडपॉइंट (महत्त्वाचे)
प्रभावित मॉडेल (महत्त्वाचे)
समस्या फास्ट मोड किंवा स्केल टियरमध्ये आहे का (महत्त्वाचे)
विलंब किंवा त्रुटींसाठी वेळ क्षेत्रासह कालावधी (महत्त्वाचे)
उपलब्ध असल्यास, संबंधित x-request-id किंवा X-Client-Request-Id
तुम्ही दिलेल्या विनंत्यांसाठी वेळ क्षेत्रासह वेळेच्या नोंदी किंवा किमान तारीख
उपलब्ध असल्यास, पुढील माहितीही द्या:
विनंत्यांशी संबंधित प्रकल्प आयडी
डेटा रेसिडेन्सीच्या विनंत्यांवर परिणाम झाला आहे का आणि कोणत्या विनंत्यांवर झाला आहे
तुम्हाला दिसत असलेल्या कलांचे वर्णन
समस्येच्या प्रकारानुसार पुढील माहिती द्या:
त्रुटी: अयशस्वी होणाऱ्या किंवा त्रुटी येणाऱ्या विनंत्यांची अंदाजे टक्केवारी, प्रतिसाद कोड, त्रुटी संदेश आणि त्रुटीचा प्रतिसाद मिळण्यास लागलेला वेळ.
विलंब: कोणती शततमके प्रभावित झाली आहेत (P50 / P90 / P95 / P99), ती ग्राहकाच्या नेहमीच्या पातळीपेक्षा किती जास्त आहेत आणि पाठवण्याच्या व मिळाल्याच्या वेळेच्या नोंदींसह संथ विनंत्यांची उदाहरणे.
दोन्ही: त्रुटी किंवा विलंबाच्या डेटाचे स्क्रीनशॉट किंवा तक्ता, तसेच त्रुटीदर किंवा विलंब अपेक्षेपेक्षा जास्त असल्याचे तुम्ही कसे ठरवले याची माहिती.
सामान्य ट्रबलशूटिंग परिस्थिती
टाइमआउट होतात पण सेवा आरोग्य सामान्य दिसते
संभाव्य कारण: विनंत्या OpenAI पर्यंत पोहोचण्यापूर्वीच टाइमआउट होत आहेत.
तपासा:
क्लायंट किंवा प्रॉक्सी टाइमआउट सेटिंग्ज
स्थानिक नेटवर्क किंवा लोड बॅलन्सर बदल
सेवा आरोग्य डॅशबोर्डमध्ये 499 त्रुटींची उपस्थिती (या तुमच्या स्वतःच्या प्रणालींमध्ये 5xx त्रुटी म्हणून दिसू शकतात).
डिप्लॉयमेंटशिवाय विलंबता वाढली
संभाव्य कारण: आउटपुट टोकन आकार किंवा रीझनिंग वापर वाढला आणि/किंवा ट्रॅफिक सेवा टियरमध्ये सरकले.
तपासा:
वापर डॅशबोर्डमधील प्रत्येक विनंतीमागील सरासरी आउटपुट टोकन (डेटा डाउनलोड करून आउटपुट टोकनना एकूण विनंत्यांनी भागणे आवश्यक).
सेवा आरोग्य डॅशबोर्डमधील विनंती वेळ आणि TTFT पर्सेंटाइल्स.
फास्ट मोड किंवा स्केल टियर मंद असल्याचे दिसते
संभाव्य कारण: वेगवेगळ्या टियरची मोजमापे एकत्र झाली आहेत, त्यामुळे मानक टियरची वाहतूक सशुल्क टियरची कामगिरी झाकत आहे.
तपासा:
फिल्टर एकाच टियर आणि मॉडेलपुरते मर्यादित आहेत.
टियरदरम्यान टोकन गतीची तुलना.
5XX त्रुटींमध्ये अचानक वाढ
संभाव्य कारण: ट्रॅफिकच्या छोट्या टक्केवारीवर परिणाम करणारे तात्पुरते अपयश.
तपासा:
त्रुटी दराची टक्केवारी
त्याच वेळी ट्रॅफिकचे प्रमाण बदलले का
समस्या फक्त एका प्रकल्पावर परिणाम करते
संभाव्य कारण: प्रकल्प-विशिष्ट कॉन्फिगरेशन किंवा वापर पॅटर्न.
तपासा:
प्रकल्प-स्तर फिल्टरिंग
अप्रभावित प्रकल्पांशी तुलना
अंतिम मुद्दे
मेट्रिक्सचा अर्थ लावण्यापूर्वी, संबंधित असल्यास मॉडेल, टियर आणि प्रकल्पानुसार फिल्टर करा.
विलंबता विश्लेषणासाठी सरासरीऐवजी पर्सेंटाइल्स वापरा.
कमी त्रुटी दर अपेक्षित असतात.
गहाळ डेटा सहसा अपस्ट्रीम समस्या दर्शवतो.
वापर डेटा विलंबता का बदलली हे स्पष्ट करण्यात मदत करू शकतो; सेवा आरोग्य वर्तन केव्हा बदलले हे दाखवते.
