ஒரு சரத்தை உட்பொதித்தலுக்கு அனுப்புவதற்கு முன், OpenAI-இன் tiktoken டோக்கனாக்கி நூலகத்தைப் பயன்படுத்தி அது எத்தனை டோக்கன்களைப் பயன்படுத்தும் என மதிப்பிடலாம்.
இது குறிப்பாகப் பயனுள்ளது. ஏனெனில் text-embedding-3-small போன்ற உட்பொதித்தல் மாடல்களுக்கு, நீங்கள் மீறக் கூடாத அதிகபட்ச டோக்கன் வரம்புகள் உள்ளன.
---
Tiktoken மூலம் டோக்கன்களை எப்படி எண்ணுவது
ஒரு சரம் உருவாக்கும் டோக்கன்களின் எண்ணிக்கையைக் கணக்கிட tiktoken Python தொகுப்பைப் பயன்படுத்தலாம்.
இதோ ஒரு மாதிரி குறியீட்டு துணுக்கு:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""ஒரு text string-இல் உள்ள டோக்கன்களின் எண்ணிக்கையை திருப்பித் தரும்."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)முக்கியம்:
மூன்றாம் தலைமுறை உட்பொதித்தல் மாடல்களுக்கு (எ.கா., text-embedding-3-small அல்லது text-embedding-3-large), "cl100k_base" குறியாக்கத்தைப் பயன்படுத்த வேண்டும்.
வெவ்வேறு மாடல்களுக்கு வெவ்வேறு குறியாக்கங்கள் தேவைப்படலாம். ஐயம் இருந்தால், எப்போதும் மாடலின் ஆவணங்களைப் பார்க்கவும்.
---
டோக்கன் எண்ணிக்கை ஏன் முக்கியம்
உங்கள் சரம் மாடலின் அதிகபட்ச உள்ளீட்டு அளவை மீறினால், உங்கள் API கோரிக்கை தோல்வியடையும்.
டோக்கன்களை முன்கூட்டியே துல்லியமாக எண்ணுவது, எம்பெட்டிங் பணிப்பாய்வுகளைச் சீராக்கி, செயலாக்கத்தின் போது பிழைகளைத் தடுக்கிறது.
---
