आढावा
OpenAI ची मॉडेल मजकुरावर प्रक्रिया करण्यासाठी टोकन ही एकके वापरतात. टोकन एखादे अक्षर, शब्दाचा भाग, पूर्ण शब्द किंवा विरामचिन्ह दर्शवू शकते. मजकूर टोकनमध्ये कसा विभागला जातो यावर मोकळ्या जागांचाही परिणाम होतो.
टोकनची संख्या आणि शब्दांची संख्या एकसारखी नसते. मॉडेल, त्याचे एन्कोडिंग आणि भाषा यांनुसार एकाच मजकुराची टोकन संख्या वेगवेगळी असू शकते.
मजकुराचे टोकनमध्ये रूपांतर कसे होते ते समजून घ्या
तुम्ही मॉडेलला मजकूर पाठवता तेव्हा:
मजकूर टोकनमध्ये विभागला जातो.
मॉडेल त्या टोकनवर प्रक्रिया करते.
मॉडेल आउटपुट टोकन निर्माण करते. यात तुम्हाला मिळणारा मजकूर आणि रीझनिंग मॉडेलच्या बाबतीत उत्तराच्या मजकुरात न दिसणारी अंतर्गत रीझनिंग टोकन समाविष्ट असू शकतात.
इंग्रजी मजकुरासाठी ढोबळ अंदाज वापरा
हे अंदाज इंग्रजी मजकुराचा आकार ठरवण्यास मदत करू शकतात:
1 टोकन म्हणजे अंदाजे 4 अक्षरे.
1 टोकन म्हणजे अंदाजे पाऊण शब्द.
100 टोकन म्हणजे अंदाजे 75 शब्द.
हे अंदाज आहेत, अचूक संख्या नाहीत. वाक्ये आणि परिच्छेदांची लांबी बदलते. इतर भाषांमध्ये अक्षरे, शब्द आणि टोकन यांतील संबंधही वेगळे असू शकतात.
मोकळ्या जागा आणि मोठ्या-लहान अक्षरांचा विचार करा
शब्दाचे लेखन, त्यातील मोठी-लहान अक्षरे आणि आजूबाजूचा मजकूर यांनुसार तो वेगवेगळ्या टोकनमध्ये विभागला जाऊ शकतो.
उदाहरणार्थ, red, Red आणि red यांतील मजकूर सारखा नाही: शेवटच्या उदाहरणाच्या सुरुवातीला मोकळी जागा आहे. एन्कोडिंगमध्ये त्यांचे निरनिराळे प्रतिनिधित्व होऊ शकते.
टोकन आयडीही एन्कोडिंगवर अवलंबून असतात. उदाहरणातील टोकन आयडी प्रत्येक मॉडेलला लागू होतो असे समजू नका.
इनपुट आणि आउटपुट टोकनमधील फरक समजून घ्या
| श्रेणी | ते कशाचे वर्णन करते |
| इनपुट टोकन | विनंतीमध्ये मॉडेलला दिलेली टोकन. यांना प्रॉम्प्ट टोकन असेही म्हणतात. |
| आउटपुट टोकन | मॉडेलने निर्माण केलेली टोकन. चॅट कम्प्लिशन्समध्ये यांना कम्प्लिशन टोकन म्हणतात. |
| कॅश केलेली इनपुट टोकन | प्रॉम्प्ट कॅशिंगद्वारे पुन्हा वापरलेली इनपुट टोकन. त्यांचे दर कॅश न केलेल्या इनपुट टोकनपेक्षा वेगळे असू शकतात. |
| रीझनिंग टोकन | दिसणारे उत्तर तयार करण्यापूर्वी रीझनिंग मॉडेल अंतर्गत वापरत असलेली टोकन. |
रीझनिंग टोकन उत्तराच्या मजकुरात दिसत नाहीत, परंतु ती आउटपुट वापरात मोजली जातात आणि त्यांचे शुल्क आउटपुट टोकन म्हणून आकारले जाते.
त्यामुळे दिसणारे उत्तर लहान असले तरी त्यासाठी दिसणाऱ्या मजकुरावरून अपेक्षित असलेल्या संख्येपेक्षा अधिक टोकन वापरली जाऊ शकतात.
विनंती पाठवण्यापूर्वी टोकन मोजा
साध्या मजकुरातील टोकन मोजा
मजकूर टोकनमध्ये कसा विभागला जातो हे पाहण्यासाठी टोकनायझर वापरा.
साध्या मजकुराचे प्रोग्रामद्वारे टोकनायझेशन करण्यासाठी tiktoken वापरा. उद्दिष्ट मॉडेलसाठी योग्य एन्कोडिंग निवडा, उदाहरणार्थ tiktoken.encoding_for_model(model) वापरून.
साध्या मजकुरातील टोकनच्या संख्येत API विनंतीमधील सर्व टोकन असतीलच असे नाही. संदेशाची रचना, साधने, स्कीमा, प्रतिमा आणि फाइल यांमुळे इनपुटच्या एकूण संख्येवर परिणाम होऊ शकतो.
रिस्पॉन्सेसचा संपूर्ण इनपुट मोजा
रिस्पॉन्सेस API चा संपूर्ण इनपुट मोजण्यासाठी इनपुट-टोकन मोजणी API वापरा.
तो संदेश, प्रतिमा, फाइल, साधने आणि संभाषणे यांसह रिस्पॉन्सेसचे इनपुट स्वरूप स्वीकारतो. त्याच्या मोजणीत संदेशांच्या भूमिका आणि सीमा यांसारख्या विनंतीच्या रचनेसाठी वापरलेली स्वरूपन टोकन समाविष्ट असतात.
इनपुटच्या संख्येवरून मॉडेल किती आउटपुट टोकन निर्माण करेल याचा अंदाज लावता येत नाही.
टोकनचा प्रत्यक्ष वापर तपासा
विनंतीनंतर तिच्या वापराची माहिती तपासा. एंडपॉइंटनुसार फील्डची नावे बदलतात:
चॅट कम्प्लिशन्समध्ये prompt_tokens, completion_tokens आणि total_tokens नोंदवले जातात.
रिस्पॉन्सेसमध्ये input_tokens, output_tokens आणि total_tokens नोंदवले जातात.
वापर डॅशबोर्डमध्ये कालांतराने झालेल्या हालचालींचाही आढावा घेता येतो. प्रवाहादरम्यानच्या वापरासह इतर सूचनांसाठी हे पाहा: API वापर आणि खर्चाचा आढावा घेणे.
मॉडेलच्या मर्यादेत राहा
मॉडेलची कॉन्टेक्स्ट विंडो आणि कमाल आउटपुट जाणून घेण्यासाठी त्याची कागदपत्रे तपासा. या मर्यादा प्रत्येक मॉडेलसाठी वेगळ्या असू शकतात.
एका विनंतीमध्ये मॉडेल किती टोकनवर काम करू शकते हे कॉन्टेक्स्ट विंडो ठरवते. मॉडेलना आउटपुटचीही मर्यादा असते. रीझनिंग मॉडेल वापरताना दिसणाऱ्या उत्तराबरोबरच रीझनिंग टोकनसाठीही जागा राखा.
इनपुट खूप मोठा असल्यास तुम्ही हे करू शकता:
प्रॉम्प्ट लहान करा किंवा त्याची पुनर्मांडणी करा.
अनावश्यक किंवा पुनरावृत्ती झालेला संदर्भ काढून टाका.
मोठे इनपुट लहान भागांमध्ये विभागा.
मजकूर पाठवण्यापूर्वी त्याचा सारांश तयार करा किंवा त्यावर पूर्वप्रक्रिया करा.
तुमच्या एंडपॉइंट आणि मॉडेलला समर्थित असलेली आउटपुट-टोकन सेटिंग वापरा. चॅट कम्प्लिशन्समध्ये max_completion_tokens वापरले जाते, तर रिस्पॉन्सेसमध्ये max_output_tokens वापरले जाते.
विनंतीच्या आकारावरील या मर्यादा API दरमर्यादा आणि मासिक वापर किंवा खर्चाच्या मर्यादांपेक्षा वेगळ्या आहेत. तुम्ही वापरत असलेल्या मॉडेलसाठी मॉडेलची कागदपत्रे पाहा.
टोकनचे दर समजून घ्या
टोकन-आधारित API दर मॉडेल आणि टोकनच्या श्रेणीवर अवलंबून असतात. इनपुट, कॅश केलेले इनपुट आणि आउटपुट टोकन यांचे दर वेगवेगळे असू शकतात. API च्या इतर क्षमतांसाठी वेगळी बिलिंग एकके वापरली जाऊ शकतात.
सध्याचे दर जाणून घेण्यासाठी API दरांचे पृष्ठ पाहा.
मॉडेलची तुलना करताना तुमचे काम पूर्ण करण्यासाठी लागणारी एकूण टोकन संख्या आणि खर्च विचारात घ्या. प्रति दशलक्ष टोकन कमी दर असल्याने एकूण खर्च कमी होईलच असे नाही: मॉडेल एकाच मजकुराचे वेगवेगळ्या प्रकारे टोकनायझेशन करू शकतात आणि आउटपुट किंवा रीझनिंगचे वेगवेगळे प्रमाण निर्माण करू शकतात.
केवळ दिसणाऱ्या प्रतिसादाच्या लांबीची तुलना न करता प्रातिनिधिक कामांची चाचणी घ्या.
एकाधिक कम्प्लिशन्सचा विचार करा
एंडपॉइंट आणि मॉडेल एकाधिक कम्प्लिशन्स निर्माण करण्यास समर्थ असल्यास त्या अतिरिक्त कम्प्लिशन्ससाठीही टोकन वापरले जातात.
चॅट कम्प्लिशन्ससाठी n चे मूल्य 1 पेक्षा जास्त ठेवल्यास एकाधिक पर्याय निर्माण होतात. त्या सर्व पर्यायांसाठी निर्माण झालेल्या टोकनचे शुल्क आकारले जाते.
जुन्या कम्प्लिशन्स API मध्ये best_of मुळे असे उमेदवार निर्माण होऊ शकतात जे सर्व परत केले जात नाहीत. उदाहरणार्थ, best_of = 3 मुळे सर्व उमेदवार मिळून 3 × max_tokens पर्यंत कम्प्लिशन टोकन निर्माण होऊ शकतात.
हे मापदंड प्रत्येक एंडपॉइंटसाठी विशिष्ट आहेत. दुसरा API किंवा मॉडेल n किंवा best_of ला समर्थन देतो असे गृहीत धरू नका.
