டோக்கன்கள் என்றால் என்ன?
OpenAI மாடல்கள் செயலாக்கும் உரையின் அடிப்படைக் கூறுகளே டோக்கன்கள். மொழி மற்றும் சூழலைப் பொறுத்து, அவை ஓர் எழுத்துக்குறி அளவுக்குச் சிறியதாகவோ ஒரு முழுச் சொல் அளவுக்கு நீளமாகவோ இருக்கலாம். இடைவெளிகள், நிறுத்தற்குறிகள், சொற்களின் பகுதிகள் ஆகிய அனைத்தும் டோக்கன் எண்ணிக்கையில் சேரும். பதிலை உருவாக்கும் முன், உங்கள் உரையை API அகநிலையில் இவ்வாறுதான் பிரிக்கிறது.
ஆங்கிலத்திற்கான பயனுள்ள தோராய விதிகள்:
1 டோக்கன் ≈ 4 எழுத்துக்குறிகள்
1 டோக்கன் ≈ ஒரு சொல்லின் ¾ பகுதி
100 டோக்கன்கள் ≈ 75 சொற்கள்
1–2 வாக்கியங்கள் ≈ 30 டோக்கன்கள்
1 பத்தி ≈ 100 டோக்கன்கள்
~1,500 சொற்கள் ≈ 2,048 டோக்கன்கள்
மாடல் மற்றும் குறியாக்கத்தைப் பொறுத்து டோக்கனைசேஷன் மாறுபடும். உங்கள் இலக்கு மாடலுக்கான சரியான எண்ணிக்கையைப் பெற, டோக்கனைசர் கருவி அல்லது tiktoken.encoding_for_model(model) என்பதைப் பயன்படுத்தவும்.
எடுத்துக்காட்டுகள்
தோராயமான டோக்கன் எண்ணிக்கைகளுடன் சில நடைமுறை உரை மாதிரிகள் இங்கே உள்ளன:
வேய்ன் கிரெட்ஸ்கியின் மேற்கோள், “நீங்கள் முயற்சிக்காத வாய்ப்புகளில் 100% தவறவிடுகிறீர்கள்” = 11 டோக்கன்கள்
OpenAI சாசனம் = 476 டோக்கன்கள்
அமெரிக்கச் சுதந்திரப் பிரகடனம் = 1,695 டோக்கன்கள்
டோக்கன் எண்ணிக்கைகள் கணக்கிடப்படும் விதம்
API-க்கு உரையை அனுப்பும்போது:
உரை டோக்கன்களாகப் பிரிக்கப்படுகிறது.
மாடல் இந்த டோக்கன்களைச் செயலாக்குகிறது.
பதில் டோக்கன்களின் வரிசையாக உருவாக்கப்பட்டு, பின்னர் மீண்டும் உரையாக மாற்றப்படுகிறது.
டோக்கன் பயன்பாடு பல வகைகளில் கண்காணிக்கப்படுகிறது:
உள்ளீட்டு டோக்கன்கள் – உங்கள் கோரிக்கையில் உள்ள டோக்கன்கள்.
வெளியீட்டு டோக்கன்கள் – பதிலில் உருவாக்கப்படும் டோக்கன்கள்.
தற்காலிகச் சேமிப்பு டோக்கன்கள் – உரையாடல் வரலாற்றிலிருந்து மீண்டும் பயன்படுத்தப்படும் டோக்கன்கள் (பெரும்பாலும் குறைந்த கட்டணம் விதிக்கப்படும்).
ரீஸனிங் டோக்கன்கள் – சில மேம்பட்ட மாடல்களில், இறுதி வெளியீட்டை உருவாக்கும் முன் கூடுதல் “சிந்தனைப் படிகள்” அகநிலையில் சேர்க்கப்படும்.
இந்த எண்ணிக்கைகள் உங்கள் API பதிலின் மேனிலைத் தரவில் இடம்பெறும்; கட்டணக் கணக்கீட்டிற்கும் பயன்பாட்டைக் கண்காணிப்பதற்கும் பயன்படுத்தப்படும்.
டோக்கனைசேஷன் பற்றி மேலும் அறிய, எங்கள் ஊடாடும் டோக்கனைசர் கருவியைப் பயன்படுத்தலாம். இதன் மூலம் டோக்கன்களின் எண்ணிக்கையைக் கணக்கிட்டு, உரை எவ்வாறு டோக்கன்களாகப் பிரிக்கப்படுகிறது என்பதைக் காணலாம்.
மாற்றாக, நிரலாக்க முறையில் உரையை டோக்கனைஸ் செய்ய விரும்பினால், OpenAI மாடல்களுக்காகப் பயன்படுத்தப்படும் வேகமான BPE டோக்கனைசரான Tiktoken என்பதைப் பயன்படுத்தவும்.
டோக்கன் வரம்புகள்
ஒவ்வொரு மாடலுக்கும் உள்ளீடு மற்றும் வெளியீடு சேர்த்து அதிகபட்ச டோக்கன் வரம்பு உள்ளது. தற்போதைய உயர் திறன் கொண்ட மாடல்கள் சூழலில் பல நூறாயிரம் டோக்கன்கள் வரை ஆதரிக்கின்றன. இருப்பினும், மாடல் பதிப்பு மற்றும் உங்கள் பயன்பாட்டு நிலையைப் பொறுத்து நடைமுறை வரம்புகள் மாறுபடலாம்.
வரம்பை மீறினால், நீங்கள் செய்யக்கூடியவை:
ப்ராம்ப்ட்களைச் சுருக்கவும் அல்லது வேறு விதமாக எழுதவும்.
பெரிய உரையைச் சிறிய பகுதிகளாகப் பிரிக்கவும்.
உள்ளீடுகளை அனுப்பும் முன் சுருக்கவும் அல்லது முன்செயலாக்கம் செய்யவும்.
டோக்கன் விலை நிர்ணயம்
API பயன்பாட்டின் விலை ஒவ்வொரு டோக்கனுக்கும் நிர்ணயிக்கப்படுகிறது; மாடல் மற்றும் டோக்கன்கள் உள்ளீடா, வெளியீடா அல்லது தற்காலிகச் சேமிப்பிலிருந்து பெறப்பட்டவையா என்பதைப் பொறுத்து அது மாறுபடும். தற்போதைய கட்டணங்களுக்கு OpenAI-இன் விலைப் பக்கத்தைப் பார்க்கவும். சில ரீஸனிங் மாடல்கள் அகநிலையில் அதிக டோக்கன்களைப் பயன்படுத்தக்கூடும். ஆனால் நிறைவுசெய்யப்படும் ஒவ்வொரு பணிக்கும் தேவைப்படும் டோக்கன்களின் எண்ணிக்கையைக் குறைத்து செயல்திறனை மேம்படுத்துவதே அவற்றின் நோக்கம்.
செயற்கை நுண்ணறிவு மாடல்கள் அல்லது வழங்குநர்கள் அனைத்திலும் டோக்கன்கள் ஒரே தரப்படுத்தலைக் கொண்டிருப்பதில்லை. வெவ்வேறு மாடல்கள் ஒரே உரையை வெவ்வேறு எண்ணிக்கையிலான டோக்கன்களைப் பயன்படுத்திச் செயலாக்கலாம் அல்லது உருவாக்கலாம். எனவே, பத்து லட்சம் டோக்கன்களுக்கான விளம்பர விலை குறைவாக இருப்பது, மொத்தச் செலவும் குறைவாக இருக்கும் என்று அவசியம் பொருள்படாது.
கண்ணுக்குத் தெரியும் பதிலின் நீளம் மட்டுமே முழு விவரத்தையும் காட்டாது. சில மாடல்கள் பதிலை உருவாக்கும் முன் ரீஸனிங் டோக்கன்களை அகநிலையில் பயன்படுத்துகின்றன. எனவே, கண்ணுக்குத் தெரியும் பதில் நீளமாக இருப்பதால் மட்டும் ஒரு மாடல் மொத்தத்தில் அதிக டோக்கன்களைப் பயன்படுத்தியதாகக் கூற முடியாது.
மாடல்களை ஒப்பிடும்போது, தேவைப்படும் மொத்த டோக்கன்களின் எண்ணிக்கையையும் வெற்றிகரமான முடிவு ஒன்றுக்கான செலவையும் கருத்தில் கொள்ளுங்கள். செயல்திறன் அளவுகோல்கள் பயனுள்ள தொடக்கப் புள்ளியாக அமையலாம். ஆனால் உங்கள் சொந்தப் பயன்பாடுகளில் மாடல்களைச் சோதிப்பதே அவற்றின் உண்மையான செலவையும் செயல்திறனையும் புரிந்துகொள்வதற்கான சிறந்த வழியாகும்.
டோக்கன்களை ஆராய்தல்
தரவுத் தொகுப்பில் சொற்கள் இடம்பெறும் சூழலுக்கு ஏற்ப API அவற்றைக் கையாளுகிறது. மாடல்கள் ப்ராம்ப்டை எடுத்துக்கொண்டு, உள்ளீட்டை டோக்கன்களின் பட்டியலாக மாற்றி, ப்ராம்ப்டைச் செயலாக்குகின்றன. பின்னர் கணிக்கப்பட்ட டோக்கன்களைப் பதிலில் நாம் காணும் சொற்களாக மாற்றுகின்றன.
நமக்கு ஒரே மாதிரியான இரண்டு சொற்களாகத் தோன்றுபவை, உரைக்குள் அவை அமைந்துள்ள விதத்தைப் பொறுத்து வெவ்வேறு டோக்கன்களாக உருவாக்கப்படலாம். உரைக்குள் உள்ள சூழலின் அடிப்படையில் ‘red’ என்ற சொல்லுக்கு API எவ்வாறு டோக்கன் மதிப்புகளை உருவாக்குகிறது என்பதைக் கவனியுங்கள்:
மேலே உள்ள முதல் எடுத்துக்காட்டில், ‘ red’ என்பதற்கான “2266” டோக்கனில் இறுதி இடைவெளியும் அடங்கும் (குறிப்பு: இவை விளக்கத்திற்காக வழங்கப்பட்ட மாதிரி டோக்கன் அடையாள எண்கள்).
‘ Red’ என்பதற்கான “2296” டோக்கன் (முன்னிலை இடைவெளியுடனும் பெரிய எழுத்தில் தொடங்குவதாலும்), சிறிய எழுத்தைக் கொண்ட ‘ red’ என்பதற்கான “2266” டோக்கனிலிருந்து வேறுபட்டது.
ஒரு வாக்கியத்தின் தொடக்கத்தில் ‘Red’ பயன்படுத்தப்படும்போது, உருவாக்கப்படும் டோக்கனில் முன்னிலை இடைவெளி இருக்காது. “7738” டோக்கன், அந்தச் சொல்லின் முந்தைய இரண்டு எடுத்துக்காட்டுகளிலிருந்தும் வேறுபட்டது.
கவனிப்புகள்:
ஒரு டோக்கன் எந்த அளவுக்கு அதிக சாத்தியமுடையதாக அல்லது அடிக்கடி பயன்படுத்தப்படுவதாக இருக்கிறதோ, அதற்கு ஒதுக்கப்படும் டோக்கன் எண் அந்த அளவுக்குக் குறைவாக இருக்கும்:
மூன்று வாக்கியங்களிலும் முற்றுப்புள்ளிக்காக உருவாக்கப்படும் டோக்கன் ஒன்றே (“13”). ஏனெனில், சூழலின் அடிப்படையில் தரவுத் தொகுப்பு முழுவதும் முற்றுப்புள்ளி ஏறக்குறைய ஒரே மாதிரியாகப் பயன்படுத்தப்படுகிறது.
வாக்கியத்தில் ‘red’ இடம்பெறும் இடத்தைப் பொறுத்து அதற்காக உருவாக்கப்படும் டோக்கன் மாறுபடும்:
வாக்கியத்தின் நடுவில் சிறிய எழுத்தில்: ‘ red’ - (டோக்கன்: “2266”)
வாக்கியத்தின் நடுவில் பெரிய எழுத்தில்: ‘ Red’ - (டோக்கன்: “2297”)
வாக்கியத்தின் தொடக்கத்தில் பெரிய எழுத்தில்: ‘Red’ - (டோக்கன்: “7738”)
