OpenAI
இந்தப் பக்கம் இயந்திரத்தால் மொழிபெயர்க்கப்பட்டுள்ளது. மூல ஆங்கிலக் கட்டுரையைப் பாருங்கள்.

டோக்கன்கள் என்றால் என்ன, அவற்றை எப்படி எண்ணுவது?

புதுப்பிக்கப்பட்டது: 2 days ago

டோக்கன்கள் என்றால் என்ன?

OpenAI மாடல்கள் செயலாக்கும் உரையின் அடிப்படைக் கூறுகளே டோக்கன்கள். மொழி மற்றும் சூழலைப் பொறுத்து, அவை ஓர் எழுத்துக்குறி அளவுக்குச் சிறியதாகவோ ஒரு முழுச் சொல் அளவுக்கு நீளமாகவோ இருக்கலாம். இடைவெளிகள், நிறுத்தற்குறிகள், சொற்களின் பகுதிகள் ஆகிய அனைத்தும் டோக்கன் எண்ணிக்கையில் சேரும். பதிலை உருவாக்கும் முன், உங்கள் உரையை API அகநிலையில் இவ்வாறுதான் பிரிக்கிறது.

ஆங்கிலத்திற்கான பயனுள்ள தோராய விதிகள்:

  • 1 டோக்கன் ≈ 4 எழுத்துக்குறிகள்

  • 1 டோக்கன் ≈ ஒரு சொல்லின் ¾ பகுதி

  • 100 டோக்கன்கள் ≈ 75 சொற்கள்

  • 1–2 வாக்கியங்கள் ≈ 30 டோக்கன்கள்

  • 1 பத்தி ≈ 100 டோக்கன்கள்

  • ~1,500 சொற்கள் ≈ 2,048 டோக்கன்கள்

மாடல் மற்றும் குறியாக்கத்தைப் பொறுத்து டோக்கனைசேஷன் மாறுபடும். உங்கள் இலக்கு மாடலுக்கான சரியான எண்ணிக்கையைப் பெற, டோக்கனைசர் கருவி அல்லது tiktoken.encoding_for_model(model) என்பதைப் பயன்படுத்தவும்.

எடுத்துக்காட்டுகள்

தோராயமான டோக்கன் எண்ணிக்கைகளுடன் சில நடைமுறை உரை மாதிரிகள் இங்கே உள்ளன:

  • வேய்ன் கிரெட்ஸ்கியின் மேற்கோள், “நீங்கள் முயற்சிக்காத வாய்ப்புகளில் 100% தவறவிடுகிறீர்கள்” = 11 டோக்கன்கள்

  • OpenAI சாசனம் = 476 டோக்கன்கள்

  • அமெரிக்கச் சுதந்திரப் பிரகடனம் = 1,695 டோக்கன்கள்

டோக்கன் எண்ணிக்கைகள் கணக்கிடப்படும் விதம்

API-க்கு உரையை அனுப்பும்போது:

  1. உரை டோக்கன்களாகப் பிரிக்கப்படுகிறது.

  2. மாடல் இந்த டோக்கன்களைச் செயலாக்குகிறது.

  3. பதில் டோக்கன்களின் வரிசையாக உருவாக்கப்பட்டு, பின்னர் மீண்டும் உரையாக மாற்றப்படுகிறது.

டோக்கன் பயன்பாடு பல வகைகளில் கண்காணிக்கப்படுகிறது:

  • உள்ளீட்டு டோக்கன்கள் – உங்கள் கோரிக்கையில் உள்ள டோக்கன்கள்.

  • வெளியீட்டு டோக்கன்கள் – பதிலில் உருவாக்கப்படும் டோக்கன்கள்.

  • தற்காலிகச் சேமிப்பு டோக்கன்கள் – உரையாடல் வரலாற்றிலிருந்து மீண்டும் பயன்படுத்தப்படும் டோக்கன்கள் (பெரும்பாலும் குறைந்த கட்டணம் விதிக்கப்படும்).

  • ரீஸனிங் டோக்கன்கள் – சில மேம்பட்ட மாடல்களில், இறுதி வெளியீட்டை உருவாக்கும் முன் கூடுதல் “சிந்தனைப் படிகள்” அகநிலையில் சேர்க்கப்படும்.

இந்த எண்ணிக்கைகள் உங்கள் API பதிலின் மேனிலைத் தரவில் இடம்பெறும்; கட்டணக் கணக்கீட்டிற்கும் பயன்பாட்டைக் கண்காணிப்பதற்கும் பயன்படுத்தப்படும்.

டோக்கனைசேஷன் பற்றி மேலும் அறிய, எங்கள் ஊடாடும் டோக்கனைசர் கருவியைப் பயன்படுத்தலாம். இதன் மூலம் டோக்கன்களின் எண்ணிக்கையைக் கணக்கிட்டு, உரை எவ்வாறு டோக்கன்களாகப் பிரிக்கப்படுகிறது என்பதைக் காணலாம்.

மாற்றாக, நிரலாக்க முறையில் உரையை டோக்கனைஸ் செய்ய விரும்பினால், OpenAI மாடல்களுக்காகப் பயன்படுத்தப்படும் வேகமான BPE டோக்கனைசரான Tiktoken என்பதைப் பயன்படுத்தவும்.

டோக்கன் வரம்புகள்

ஒவ்வொரு மாடலுக்கும் உள்ளீடு மற்றும் வெளியீடு சேர்த்து அதிகபட்ச டோக்கன் வரம்பு உள்ளது. தற்போதைய உயர் திறன் கொண்ட மாடல்கள் சூழலில் பல நூறாயிரம் டோக்கன்கள் வரை ஆதரிக்கின்றன. இருப்பினும், மாடல் பதிப்பு மற்றும் உங்கள் பயன்பாட்டு நிலையைப் பொறுத்து நடைமுறை வரம்புகள் மாறுபடலாம்.

வரம்பை மீறினால், நீங்கள் செய்யக்கூடியவை:

  • ப்ராம்ப்ட்களைச் சுருக்கவும் அல்லது வேறு விதமாக எழுதவும்.

  • பெரிய உரையைச் சிறிய பகுதிகளாகப் பிரிக்கவும்.

  • உள்ளீடுகளை அனுப்பும் முன் சுருக்கவும் அல்லது முன்செயலாக்கம் செய்யவும்.

டோக்கன் விலை நிர்ணயம்

API பயன்பாட்டின் விலை ஒவ்வொரு டோக்கனுக்கும் நிர்ணயிக்கப்படுகிறது; மாடல் மற்றும் டோக்கன்கள் உள்ளீடா, வெளியீடா அல்லது தற்காலிகச் சேமிப்பிலிருந்து பெறப்பட்டவையா என்பதைப் பொறுத்து அது மாறுபடும். தற்போதைய கட்டணங்களுக்கு OpenAI-இன் விலைப் பக்கத்தைப் பார்க்கவும். சில ரீஸனிங் மாடல்கள் அகநிலையில் அதிக டோக்கன்களைப் பயன்படுத்தக்கூடும். ஆனால் நிறைவுசெய்யப்படும் ஒவ்வொரு பணிக்கும் தேவைப்படும் டோக்கன்களின் எண்ணிக்கையைக் குறைத்து செயல்திறனை மேம்படுத்துவதே அவற்றின் நோக்கம்.

செயற்கை நுண்ணறிவு மாடல்கள் அல்லது வழங்குநர்கள் அனைத்திலும் டோக்கன்கள் ஒரே தரப்படுத்தலைக் கொண்டிருப்பதில்லை. வெவ்வேறு மாடல்கள் ஒரே உரையை வெவ்வேறு எண்ணிக்கையிலான டோக்கன்களைப் பயன்படுத்திச் செயலாக்கலாம் அல்லது உருவாக்கலாம். எனவே, பத்து லட்சம் டோக்கன்களுக்கான விளம்பர விலை குறைவாக இருப்பது, மொத்தச் செலவும் குறைவாக இருக்கும் என்று அவசியம் பொருள்படாது.

கண்ணுக்குத் தெரியும் பதிலின் நீளம் மட்டுமே முழு விவரத்தையும் காட்டாது. சில மாடல்கள் பதிலை உருவாக்கும் முன் ரீஸனிங் டோக்கன்களை அகநிலையில் பயன்படுத்துகின்றன. எனவே, கண்ணுக்குத் தெரியும் பதில் நீளமாக இருப்பதால் மட்டும் ஒரு மாடல் மொத்தத்தில் அதிக டோக்கன்களைப் பயன்படுத்தியதாகக் கூற முடியாது.

மாடல்களை ஒப்பிடும்போது, தேவைப்படும் மொத்த டோக்கன்களின் எண்ணிக்கையையும் வெற்றிகரமான முடிவு ஒன்றுக்கான செலவையும் கருத்தில் கொள்ளுங்கள். செயல்திறன் அளவுகோல்கள் பயனுள்ள தொடக்கப் புள்ளியாக அமையலாம். ஆனால் உங்கள் சொந்தப் பயன்பாடுகளில் மாடல்களைச் சோதிப்பதே அவற்றின் உண்மையான செலவையும் செயல்திறனையும் புரிந்துகொள்வதற்கான சிறந்த வழியாகும்.

டோக்கன்களை ஆராய்தல்

தரவுத் தொகுப்பில் சொற்கள் இடம்பெறும் சூழலுக்கு ஏற்ப API அவற்றைக் கையாளுகிறது. மாடல்கள் ப்ராம்ப்டை எடுத்துக்கொண்டு, உள்ளீட்டை டோக்கன்களின் பட்டியலாக மாற்றி, ப்ராம்ப்டைச் செயலாக்குகின்றன. பின்னர் கணிக்கப்பட்ட டோக்கன்களைப் பதிலில் நாம் காணும் சொற்களாக மாற்றுகின்றன.

நமக்கு ஒரே மாதிரியான இரண்டு சொற்களாகத் தோன்றுபவை, உரைக்குள் அவை அமைந்துள்ள விதத்தைப் பொறுத்து வெவ்வேறு டோக்கன்களாக உருவாக்கப்படலாம். உரைக்குள் உள்ள சூழலின் அடிப்படையில் ‘red’ என்ற சொல்லுக்கு API எவ்வாறு டோக்கன் மதிப்புகளை உருவாக்குகிறது என்பதைக் கவனியுங்கள்:

Sentence split into color-coded tokens with Text selected over Token IDs
Token ID output as a list of integers with the Token IDs tab selected

மேலே உள்ள முதல் எடுத்துக்காட்டில், ‘ red’ என்பதற்கான “2266” டோக்கனில் இறுதி இடைவெளியும் அடங்கும் (குறிப்பு: இவை விளக்கத்திற்காக வழங்கப்பட்ட மாதிரி டோக்கன் அடையாள எண்கள்).

Sentence split into color-coded token blocks: My favorite color is Red.
Tokenizer output with Token IDs selected and a list of numeric token IDs

‘ Red’ என்பதற்கான “2296” டோக்கன் (முன்னிலை இடைவெளியுடனும் பெரிய எழுத்தில் தொடங்குவதாலும்), சிறிய எழுத்தைக் கொண்ட ‘ red’ என்பதற்கான “2266” டோக்கனிலிருந்து வேறுபட்டது.

Tokenizer example splitting “Red is my favorite color.” into color-coded tokens
Tokenizer output with Token IDs selected and a list of token ID numbers

ஒரு வாக்கியத்தின் தொடக்கத்தில் ‘Red’ பயன்படுத்தப்படும்போது, உருவாக்கப்படும் டோக்கனில் முன்னிலை இடைவெளி இருக்காது. “7738” டோக்கன், அந்தச் சொல்லின் முந்தைய இரண்டு எடுத்துக்காட்டுகளிலிருந்தும் வேறுபட்டது.

கவனிப்புகள்:

ஒரு டோக்கன் எந்த அளவுக்கு அதிக சாத்தியமுடையதாக அல்லது அடிக்கடி பயன்படுத்தப்படுவதாக இருக்கிறதோ, அதற்கு ஒதுக்கப்படும் டோக்கன் எண் அந்த அளவுக்குக் குறைவாக இருக்கும்:

  • மூன்று வாக்கியங்களிலும் முற்றுப்புள்ளிக்காக உருவாக்கப்படும் டோக்கன் ஒன்றே (“13”). ஏனெனில், சூழலின் அடிப்படையில் தரவுத் தொகுப்பு முழுவதும் முற்றுப்புள்ளி ஏறக்குறைய ஒரே மாதிரியாகப் பயன்படுத்தப்படுகிறது.

  • வாக்கியத்தில் ‘red’ இடம்பெறும் இடத்தைப் பொறுத்து அதற்காக உருவாக்கப்படும் டோக்கன் மாறுபடும்:

    • வாக்கியத்தின் நடுவில் சிறிய எழுத்தில்: ‘ red’ - (டோக்கன்: “2266”)

    • வாக்கியத்தின் நடுவில் பெரிய எழுத்தில்: ‘ Red’ - (டோக்கன்: “2297”)

    • வாக்கியத்தின் தொடக்கத்தில் பெரிய எழுத்தில்: ‘Red’ - (டோக்கன்: “7738”)

இந்தக் கட்டுரை உங்களுக்கு உதவியாக இருந்ததா?