OpenAI
या पेजला मशीनद्वारे भाषांतरित केले आहे. मूळ इंग्रजी लेख पहा.

मी एखादी स्ट्रिंग embed करण्यापूर्वी त्यात किती टोकन असतील हे कसे सांगू?

एम्बेडिंगसाठी टोकन मोजणे/अंदाज करणे

अपडेट केले: 8 days ago

embedding साठी स्ट्रिंग पाठवण्यापूर्वी, OpenAI ची tiktoken tokenizer library वापरून ती किती टोकन वापरेल याचा अंदाज तुम्ही लावू शकता.

हे विशेषतः उपयुक्त आहे कारण embedding मॉडेलना (जसे text-embedding-3-small) कमाल टोकन मर्यादा असतात आणि तुम्हाला त्या मर्यादेत राहावे लागते.

---

Tiktoken वापरून टोकन कसे मोजायचे

एखादी स्ट्रिंग किती टोकन निर्माण करेल हे मोजण्यासाठी तुम्ही tiktoken Python पॅकेज वापरू शकता.

येथे नमुना कोड स्निपेट आहे:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""मजकूर स्ट्रिंगमधील टोकनची संख्या परत करते."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

महत्त्वाचे:

  • तिसऱ्या पिढीच्या embedding मॉडेलसाठी (उदा., text-embedding-3-small किंवा text-embedding-3-large), तुम्ही "cl100k_base" encoding वापरावे.

  • वेगवेगळ्या मॉडेलना वेगवेगळ्या encoding ची आवश्यकता असू शकते — खात्री नसल्यास नेहमी मॉडेलच्या दस्तऐवजीकरणाचा संदर्भ घ्या.

---

टोकन मोजणे महत्त्वाचे का आहे

  • तुमची स्ट्रिंग मॉडेलच्या कमाल इनपुट आकारापेक्षा जास्त असल्यास, तुमची API विनंती अयशस्वी होईल.

  • आधीच अचूकपणे टोकन मोजल्याने embedding वर्कफ्लो अधिक सुरळीत होतात आणि प्रक्रियेदरम्यान त्रुटी टाळता येतात.

---

हा लेख उपयुक्त आहे का?