OpenAI
இந்தப் பக்கம் இயந்திரத்தால் மொழிபெயர்க்கப்பட்டுள்ளது. மூல ஆங்கிலக் கட்டுரையைப் பாருங்கள்.

ஒரு string-ஐ embed செய்ய முன் அதில் எத்தனை டோக்கன்கள் இருக்கும் என்று எப்படி தெரிந்துகொள்வது?

ஒரு embedding-க்கான டோக்கன்களை கணக்கிடுதல்/தோராயமாக மதிப்பிடுதல்

புதுப்பிக்கப்பட்டது: 8 days ago

எம்பெட்டிங்கிற்காக ஒரு சரத்தை அனுப்புவதற்கு முன், அது எத்தனை டோக்கன்களைப் பயன்படுத்தும் என்பதை OpenAI-யின் tiktoken டோக்கனைசர் நூலகத்தைப் பயன்படுத்தி மதிப்பிடலாம்.

இது குறிப்பாக பயனுள்ளது, ஏனெனில் எம்பெட்டிங் மாடல்களுக்கு (text-embedding-3-small போன்றவை) அதிகபட்ச டோக்கன் வரம்புகள் உள்ளன; அவற்றுக்குள் நீங்கள் இருக்க வேண்டும்.

---

Tiktoken மூலம் டோக்கன்களை எப்படி எண்ணுவது

ஒரு சரம் உருவாக்கும் டோக்கன்களின் எண்ணிக்கையைக் கணக்கிட tiktoken Python தொகுப்பைப் பயன்படுத்தலாம்.

இதோ ஒரு மாதிரி குறியீட்டு துணுக்கு:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""ஒரு text string-இல் உள்ள டோக்கன்களின் எண்ணிக்கையை திருப்பித் தரும்."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

முக்கியம்:

  • மூன்றாம் தலைமுறை எம்பெட்டிங் மாடல்களுக்கு (எ.கா., text-embedding-3-small அல்லது text-embedding-3-large), நீங்கள் "cl100k_base" என்கோடிங்கைப் பயன்படுத்த வேண்டும்.

  • வெவ்வேறு மாடல்களுக்கு வெவ்வேறு என்கோடிங்குகள் தேவைப்படலாம் — உறுதியாகத் தெரியாவிட்டால், எப்போதும் மாடல் ஆவணங்களைப் பார்க்கவும்.

---

டோக்கன் எண்ணிக்கை ஏன் முக்கியம்

  • உங்கள் சரம் மாடலின் அதிகபட்ச உள்ளீட்டு அளவை மீறினால், உங்கள் API கோரிக்கை தோல்வியடையும்.

  • டோக்கன்களை முன்கூட்டியே துல்லியமாக எண்ணுவது, எம்பெட்டிங் பணிப்பாய்வுகளைச் சீராக்கி, செயலாக்கத்தின் போது பிழைகளைத் தடுக்கிறது.

---

இந்தக் கட்டுரை உங்களுக்கு உதவியாக இருந்ததா?