OpenAI
या पेजला मशीनद्वारे भाषांतरित केले आहे. मूळ इंग्रजी लेख पहा.

मी एखादी स्ट्रिंग embed करण्यापूर्वी त्यात किती टोकन असतील हे कसे सांगू?

एम्बेडिंगसाठी टोकन मोजणे/अंदाज करणे

अपडेट केले: 17 days ago

एम्बेडिंगसाठी स्ट्रिंग पाठवण्यापूर्वी, OpenAI चे tiktoken टोकनायझर ग्रंथालय वापरून त्यासाठी किती टोकन लागतील याचा अंदाज घेता येतो.

हे विशेषतः उपयुक्त आहे, कारण एम्बेडिंग मॉडेल्सना (उदा., text-embedding-3-small) टोकनची कमाल मर्यादा असते आणि तुम्हाला तिच्या आत राहावे लागते.

---

Tiktoken वापरून टोकन कसे मोजायचे

एखादी स्ट्रिंग किती टोकन निर्माण करेल हे मोजण्यासाठी तुम्ही tiktoken Python पॅकेज वापरू शकता.

येथे नमुना कोड स्निपेट आहे:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""मजकूर स्ट्रिंगमधील टोकनची संख्या परत करते."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

महत्त्वाचे:

  • तिसऱ्या पिढीतील एम्बेडिंग मॉडेल्ससाठी (उदा., text-embedding-3-small किंवा text-embedding-3-large) तुम्ही "cl100k_base" एन्कोडिंग वापरावे.

  • वेगवेगळ्या मॉडेल्सना वेगवेगळे एन्कोडिंग लागू शकते—खात्री नसल्यास नेहमी मॉडेलचे दस्तऐवजीकरण पाहा.

---

टोकन मोजणे महत्त्वाचे का आहे

  • तुमची स्ट्रिंग मॉडेलच्या कमाल इनपुट आकारापेक्षा जास्त असल्यास, तुमची API विनंती अयशस्वी होईल.

  • आधीच अचूकपणे टोकन मोजल्याने embedding वर्कफ्लो अधिक सुरळीत होतात आणि प्रक्रियेदरम्यान त्रुटी टाळता येतात.

---

हा लेख उपयुक्त आहे का?