embedding साठी स्ट्रिंग पाठवण्यापूर्वी, OpenAI ची tiktoken tokenizer library वापरून ती किती टोकन वापरेल याचा अंदाज तुम्ही लावू शकता.
हे विशेषतः उपयुक्त आहे कारण embedding मॉडेलना (जसे text-embedding-3-small) कमाल टोकन मर्यादा असतात आणि तुम्हाला त्या मर्यादेत राहावे लागते.
---
Tiktoken वापरून टोकन कसे मोजायचे
एखादी स्ट्रिंग किती टोकन निर्माण करेल हे मोजण्यासाठी तुम्ही tiktoken Python पॅकेज वापरू शकता.
येथे नमुना कोड स्निपेट आहे:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""मजकूर स्ट्रिंगमधील टोकनची संख्या परत करते."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)महत्त्वाचे:
तिसऱ्या पिढीच्या embedding मॉडेलसाठी (उदा.,
text-embedding-3-smallकिंवाtext-embedding-3-large), तुम्ही"cl100k_base"encoding वापरावे.वेगवेगळ्या मॉडेलना वेगवेगळ्या encoding ची आवश्यकता असू शकते — खात्री नसल्यास नेहमी मॉडेलच्या दस्तऐवजीकरणाचा संदर्भ घ्या.
---
टोकन मोजणे महत्त्वाचे का आहे
तुमची स्ट्रिंग मॉडेलच्या कमाल इनपुट आकारापेक्षा जास्त असल्यास, तुमची API विनंती अयशस्वी होईल.
आधीच अचूकपणे टोकन मोजल्याने embedding वर्कफ्लो अधिक सुरळीत होतात आणि प्रक्रियेदरम्यान त्रुटी टाळता येतात.
---
