எம்பெட்டிங்கிற்காக ஒரு சரத்தை அனுப்புவதற்கு முன், அது எத்தனை டோக்கன்களைப் பயன்படுத்தும் என்பதை OpenAI-யின் tiktoken டோக்கனைசர் நூலகத்தைப் பயன்படுத்தி மதிப்பிடலாம்.
இது குறிப்பாக பயனுள்ளது, ஏனெனில் எம்பெட்டிங் மாடல்களுக்கு (text-embedding-3-small போன்றவை) அதிகபட்ச டோக்கன் வரம்புகள் உள்ளன; அவற்றுக்குள் நீங்கள் இருக்க வேண்டும்.
---
Tiktoken மூலம் டோக்கன்களை எப்படி எண்ணுவது
ஒரு சரம் உருவாக்கும் டோக்கன்களின் எண்ணிக்கையைக் கணக்கிட tiktoken Python தொகுப்பைப் பயன்படுத்தலாம்.
இதோ ஒரு மாதிரி குறியீட்டு துணுக்கு:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""ஒரு text string-இல் உள்ள டோக்கன்களின் எண்ணிக்கையை திருப்பித் தரும்."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)முக்கியம்:
மூன்றாம் தலைமுறை எம்பெட்டிங் மாடல்களுக்கு (எ.கா.,
text-embedding-3-smallஅல்லதுtext-embedding-3-large), நீங்கள்"cl100k_base"என்கோடிங்கைப் பயன்படுத்த வேண்டும்.வெவ்வேறு மாடல்களுக்கு வெவ்வேறு என்கோடிங்குகள் தேவைப்படலாம் — உறுதியாகத் தெரியாவிட்டால், எப்போதும் மாடல் ஆவணங்களைப் பார்க்கவும்.
---
டோக்கன் எண்ணிக்கை ஏன் முக்கியம்
உங்கள் சரம் மாடலின் அதிகபட்ச உள்ளீட்டு அளவை மீறினால், உங்கள் API கோரிக்கை தோல்வியடையும்.
டோக்கன்களை முன்கூட்டியே துல்லியமாக எண்ணுவது, எம்பெட்டிங் பணிப்பாய்வுகளைச் சீராக்கி, செயலாக்கத்தின் போது பிழைகளைத் தடுக்கிறது.
---
