OpenAI
اس صفحے کا مشینی ترجمہ کیا گیا تھا. اصل انگریزی مضمون دیکھیں.

میں کیسے معلوم کروں کہ کسی اسٹرنگ کو embed کرنے سے پہلے اس میں کتنے ٹوکن ہوں گے؟

ایمبیڈنگ کے لیے ٹوکنز کا حساب/تخمینہ

آخری اپ ڈیٹ: 17 days ago

امبیڈنگ کے لیے کوئی متنی سلسلہ بھیجنے سے پہلے، آپ OpenAI کی tiktoken ٹوکن ساز لائبریری استعمال کر کے اندازہ لگا سکتے ہیں کہ اس میں کتنے ٹوکن استعمال ہوں گے.

یہ خاص طور پر مفید ہے کیونکہ امبیڈنگ ماڈلز (جیسے text-embedding-3-small) میں ٹوکنز کی زیادہ سے زیادہ حد ہوتی ہے، جس کے اندر رہنا ضروری ہے.

---

Tiktoken کے ساتھ ٹوکنز کیسے گنیں

آپ tiktoken Python پیکیج استعمال کر کے کسی اسٹرنگ سے بننے والے ٹوکنز کی تعداد کا حساب لگا سکتے ہیں۔

یہاں ایک نمونہ کوڈ اسنیپٹ ہے:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""ایک ٹیکسٹ اسٹرنگ میں ٹوکنز کی تعداد واپس کرتا ہے۔"""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# مثال کے طور پر استعمال
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

اہم:

  • تیسری نسل کے امبیڈنگ ماڈلز (مثلاً text-embedding-3-small یا text-embedding-3-large) کے لیے آپ کو "cl100k_base" انکوڈنگ استعمال کرنی چاہیے.

  • مختلف ماڈلز کے لیے مختلف انکوڈنگز درکار ہو سکتی ہیں—اگر شک ہو تو ہمیشہ ماڈل کی دستاویزات دیکھیں.

---

ٹوکن گننا کیوں اہم ہے

  • اگر آپ کی اسٹرنگ ماڈل کے زیادہ سے زیادہ ان پٹ سائز سے بڑھ جائے، تو آپ کی API درخواست ناکام ہو جائے گی۔

  • وقت سے پہلے ٹوکنز کو درست طور پر گننا ایمبیڈنگ ورک فلوز کو زیادہ ہموار بناتا ہے اور پروسیسنگ کے دوران خرابیوں کو روکتا ہے۔

---

کیا یہ آرٹیکل مددگار تھا؟