एम्बेडिंगसाठी स्ट्रिंग पाठवण्यापूर्वी, OpenAI चे tiktoken टोकनायझर ग्रंथालय वापरून त्यासाठी किती टोकन लागतील याचा अंदाज घेता येतो.
हे विशेषतः उपयुक्त आहे, कारण एम्बेडिंग मॉडेल्सना (उदा., text-embedding-3-small) टोकनची कमाल मर्यादा असते आणि तुम्हाला तिच्या आत राहावे लागते.
---
Tiktoken वापरून टोकन कसे मोजायचे
एखादी स्ट्रिंग किती टोकन निर्माण करेल हे मोजण्यासाठी तुम्ही tiktoken Python पॅकेज वापरू शकता.
येथे नमुना कोड स्निपेट आहे:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""मजकूर स्ट्रिंगमधील टोकनची संख्या परत करते."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)महत्त्वाचे:
तिसऱ्या पिढीतील एम्बेडिंग मॉडेल्ससाठी (उदा., text-embedding-3-small किंवा text-embedding-3-large) तुम्ही "cl100k_base" एन्कोडिंग वापरावे.
वेगवेगळ्या मॉडेल्सना वेगवेगळे एन्कोडिंग लागू शकते—खात्री नसल्यास नेहमी मॉडेलचे दस्तऐवजीकरण पाहा.
---
टोकन मोजणे महत्त्वाचे का आहे
तुमची स्ट्रिंग मॉडेलच्या कमाल इनपुट आकारापेक्षा जास्त असल्यास, तुमची API विनंती अयशस्वी होईल.
आधीच अचूकपणे टोकन मोजल्याने embedding वर्कफ्लो अधिक सुरळीत होतात आणि प्रक्रियेदरम्यान त्रुटी टाळता येतात.
---
