OpenAI
இந்தப் பக்கம் இயந்திரத்தால் மொழிபெயர்க்கப்பட்டுள்ளது. மூல ஆங்கிலக் கட்டுரையைப் பாருங்கள்.

ஒரு string-ஐ embed செய்ய முன் அதில் எத்தனை டோக்கன்கள் இருக்கும் என்று எப்படி தெரிந்துகொள்வது?

ஒரு embedding-க்கான டோக்கன்களை கணக்கிடுதல்/தோராயமாக மதிப்பிடுதல்

புதுப்பிக்கப்பட்டது: 5 days ago

ஒரு சரத்தை உட்பொதித்தலுக்கு அனுப்புவதற்கு முன், OpenAI-இன் tiktoken டோக்கனாக்கி நூலகத்தைப் பயன்படுத்தி அது எத்தனை டோக்கன்களைப் பயன்படுத்தும் என மதிப்பிடலாம்.

இது குறிப்பாகப் பயனுள்ளது. ஏனெனில் text-embedding-3-small போன்ற உட்பொதித்தல் மாடல்களுக்கு, நீங்கள் மீறக் கூடாத அதிகபட்ச டோக்கன் வரம்புகள் உள்ளன.

---

Tiktoken மூலம் டோக்கன்களை எப்படி எண்ணுவது

ஒரு சரம் உருவாக்கும் டோக்கன்களின் எண்ணிக்கையைக் கணக்கிட tiktoken Python தொகுப்பைப் பயன்படுத்தலாம்.

இதோ ஒரு மாதிரி குறியீட்டு துணுக்கு:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""ஒரு text string-இல் உள்ள டோக்கன்களின் எண்ணிக்கையை திருப்பித் தரும்."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

முக்கியம்:

  • மூன்றாம் தலைமுறை உட்பொதித்தல் மாடல்களுக்கு (எ.கா., text-embedding-3-small அல்லது text-embedding-3-large), "cl100k_base" குறியாக்கத்தைப் பயன்படுத்த வேண்டும்.

  • வெவ்வேறு மாடல்களுக்கு வெவ்வேறு குறியாக்கங்கள் தேவைப்படலாம். ஐயம் இருந்தால், எப்போதும் மாடலின் ஆவணங்களைப் பார்க்கவும்.

---

டோக்கன் எண்ணிக்கை ஏன் முக்கியம்

  • உங்கள் சரம் மாடலின் அதிகபட்ச உள்ளீட்டு அளவை மீறினால், உங்கள் API கோரிக்கை தோல்வியடையும்.

  • டோக்கன்களை முன்கூட்டியே துல்லியமாக எண்ணுவது, எம்பெட்டிங் பணிப்பாய்வுகளைச் சீராக்கி, செயலாக்கத்தின் போது பிழைகளைத் தடுக்கிறது.

---

இந்தக் கட்டுரை உங்களுக்கு உதவியாக இருந்ததா?