OpenAI
இந்தப் பக்கம் இயந்திரத்தால் மொழிபெயர்க்கப்பட்டுள்ளது. மூல ஆங்கிலக் கட்டுரையைப் பாருங்கள்.

டோக்கன்கள் என்றால் என்ன, அவற்றை எப்படி எண்ணுவது?

புதுப்பிக்கப்பட்டது: 8 days ago

டோக்கன்கள் என்றால் என்ன?

டோக்கன்கள் என்பது OpenAI மாடல்கள் செயலாக்கும் உரையின் அடிப்படை கூறுகள். மொழி மற்றும் சூழலைப் பொறுத்து, அவை ஒற்றை எழுத்து அளவுக்கு குறுகியதாகவோ முழு சொல் அளவுக்கு நீளமானதாகவோ இருக்கலாம். இடைவெளிகள், நிறுத்தக்குறிகள், பகுதி சொற்கள் ஆகிய அனைத்தும் டோக்கன் எண்ணிக்கையில் சேரும். பதிலை உருவாக்கும் முன் API உங்கள் உரையை உள்முறையில் இவ்வாறே பிரிக்கிறது.

ஆங்கிலத்திற்கான பயனுள்ள தோராய விதிகள்:

  • 1 டோக்கன் ≈ 4 எழுத்துகள்

  • 1 டோக்கன் ≈ ஒரு சொல்லின் ¾

  • 100 டோக்கன்கள் ≈ 75 சொற்கள்

  • 1–2 வாக்கியங்கள் ≈ 30 டோக்கன்கள்

  • 1 பத்தி ≈ 100 டோக்கன்கள்

  • ~1,500 சொற்கள் ≈ 2,048 டோக்கன்கள்

டோக்கனைசேஷன் மாடல் மற்றும் என்கோடிங்கைப் பொறுத்து மாறுபடும். உங்கள் இலக்கு மாடலுக்கான துல்லிய எண்ணிக்கையைப் பெற Tokenizer கருவி அல்லது tiktoken.encoding_for_model(model) ஐப் பயன்படுத்துங்கள்.

எடுத்துக்காட்டுகள்

தோராய டோக்கன் எண்ணிக்கைகளுடன் சில நிஜ உலக உரை மாதிரிகள் இங்கே:

  • Wayne Gretzky-யின் மேற்கோள் “நீங்கள் எடுக்காத ஷாட்களில் 100% தவறவிடுகிறீர்கள்” = 11 டோக்கன்கள்

  • OpenAI சாசனம் = 476 டோக்கன்கள்

  • அமெரிக்க சுதந்திரப் பிரகடனம் = 1,695 டோக்கன்கள்

டோக்கன் எண்ணிக்கைகள் எவ்வாறு கணக்கிடப்படுகின்றன

நீங்கள் API-க்கு உரை அனுப்பும்போது:

  1. உரை டோக்கன்களாகப் பிரிக்கப்படுகிறது.

  2. மாடல் இந்த டோக்கன்களை செயலாக்குகிறது.

  3. பதில் டோக்கன்களின் வரிசையாக உருவாக்கப்பட்டு, பின்னர் மீண்டும் உரையாக மாற்றப்படுகிறது.

டோக்கன் பயன்பாடு பல வகைகளில் கண்காணிக்கப்படுகிறது:

  • உள்ளீட்டு டோக்கன்கள் – உங்கள் கோரிக்கையில் உள்ள டோக்கன்கள்.

  • வெளியீட்டு டோக்கன்கள் – பதிலில் உருவாக்கப்படும் டோக்கன்கள்.

  • கேச் செய்யப்பட்ட டோக்கன்கள் – உரையாடல் வரலாற்றில் மீண்டும் பயன்படுத்தப்படும் டோக்கன்கள் (பெரும்பாலும் குறைந்த கட்டணத்தில் பில் செய்யப்படும்).

  • ரீஸனிங் டோக்கன்கள் – சில மேம்பட்ட மாடல்களில், இறுதி வெளியீட்டை உருவாக்குவதற்கு முன் கூடுதல் “சிந்தனைப் படிகள்” உள்முறையில் சேர்க்கப்படும்.

இந்த எண்ணிக்கைகள் உங்கள் API பதில் மெட்டாடேட்டாவில் தோன்றும்; பில்லிங் மற்றும் பயன்பாட்டுக் கண்காணிப்புக்கு பயன்படுத்தப்படும்.

டோக்கனைசேஷனை மேலும் ஆராய, எங்கள் இடையூறு செயல்பாட்டு Tokenizer கருவியைப் பயன்படுத்தலாம்; இது டோக்கன்களின் எண்ணிக்கையை கணக்கிடவும் உரை டோக்கன்களாக எவ்வாறு பிரிக்கப்படுகிறது என்பதைப் பார்க்கவும் உதவும்.

மாற்றாக, நிரலாக்க முறையில் உரையை டோக்கனைஸ் செய்ய விரும்பினால், OpenAI மாடல்களுக்காக குறிப்பாகப் பயன்படுத்தப்படும் வேகமான BPE டோக்கனைசராக Tiktoken ஐப் பயன்படுத்துங்கள்.

டோக்கன் வரம்புகள்

ஒவ்வொரு மாடலுக்கும் அதிகபட்ச ஒருங்கிணைந்த டோக்கன் வரம்பு (உள்ளீடு + வெளியீடு) உள்ளது. தற்போதைய அதிக திறன் மாடல்கள் சூழலில் நூறாயிரக்கணக்கான டோக்கன்கள் வரை ஆதரிக்கின்றன; ஆனால் நடைமுறை வரம்புகள் மாடல் பதிப்பு மற்றும் உங்கள் பயன்பாட்டு அடுக்கைப் பொறுத்து மாறலாம்.

நீங்கள் வரம்பை மீறினால், நீங்கள் செய்யக்கூடியவை:

  • ப்ராம்ப்ட்களைச் சுருக்கவும் அல்லது வேறு விதமாக எழுதவும்.

  • பெரிய உரையை சிறிய பகுதிகளாகப் பிரிக்கவும்.

  • உள்ளீடுகளை அனுப்புவதற்கு முன் சுருக்கவும் அல்லது முன்செயலாக்கம் செய்யவும்.

டோக்கன் விலை நிர்ணயம்

API பயன்பாட்டின் விலை ஒவ்வொரு டோக்கன் அடிப்படையில் நிர்ணயிக்கப்படுகிறது; மாடல் மற்றும் டோக்கன்கள் உள்ளீடு, வெளியீடு அல்லது கேச் செய்யப்பட்டவையா என்பதைப் பொறுத்து மாறுபடும். தற்போதைய கட்டணங்களுக்கு OpenAI-ன் விலை நிர்ணயப் பக்கத்தைப் பார்க்கவும். சில ரீஸனிங் மாடல்கள் உள்முறையில் அதிக டோக்கன்களைப் பயன்படுத்தலாம்; ஆனால் முடிக்கப்பட்ட ஒவ்வொரு பணிக்கும் தேவையான டோக்கன்களின் எண்ணிக்கையை குறைப்பதன் மூலம் திறனை மேம்படுத்த இலக்கு வைக்கின்றன.

டோக்கன்களை ஆராய்தல்

API சொற்களை கார்ப்பஸ் தரவிலுள்ள அவற்றின் சூழலின்படி கையாளுகிறது. மாடல்கள் ப்ராம்ப்டை எடுத்து, உள்ளீட்டை டோக்கன்களின் பட்டியலாக மாற்றி, ப்ராம்ப்டை செயலாக்கி, கணிக்கப்பட்ட டோக்கன்களை நாம் பதிலில் காணும் சொற்களாக மீண்டும் மாற்றுகின்றன.

நமக்கு ஒரே மாதிரியாகத் தோன்றும் இரண்டு சொற்கள், உரையில் அவை எவ்வாறு அமைந்துள்ளன என்பதன் அடிப்படையில் வேறு டோக்கன்களாக உருவாக்கப்படலாம். உரையிலுள்ள சூழலை அடிப்படையாகக் கொண்டு ‘red’ என்ற சொல்லுக்கு API எவ்வாறு டோக்கன் மதிப்புகளை உருவாக்குகிறது என்பதை கவனியுங்கள்:

Sentence split into color-coded tokens with Text selected over Token IDs
Token ID output as a list of integers with the Token IDs tab selected

மேலுள்ள முதல் எடுத்துக்காட்டில் ‘ red’ க்கான டோக்கன் “2266” ஒரு பின்வரும் இடைவெளியை உள்ளடக்கியுள்ளது (குறிப்பு: இவை விளக்க நோக்கங்களுக்கான எடுத்துக்காட்டு டோக்கன் ID-கள்).

Sentence split into color-coded token blocks: My favorite color is Red.
Tokenizer output with Token IDs selected and a list of numeric token IDs

‘ Red’ க்கான டோக்கன் “2296” (முன்னணி இடைவெளியுடன் மற்றும் பெரிய எழுத்தில் தொடங்குவது) சிறிய எழுத்துள்ள ‘ red’ க்கான டோக்கன் “2266” இலிருந்து வேறுபட்டது.

Tokenizer example splitting “Red is my favorite color.” into color-coded tokens
Tokenizer output with Token IDs selected and a list of token ID numbers

‘Red’ ஒரு வாக்கியத்தின் தொடக்கத்தில் பயன்படுத்தப்படும்போது, உருவாக்கப்படும் டோக்கனில் முன்னணி இடைவெளி இருக்காது. டோக்கன் “7738” இந்த சொல்லின் முந்தைய இரண்டு எடுத்துக்காட்டுகளிலிருந்து வேறுபட்டது.

கவனிப்புகள்:

ஒரு டோக்கன் அதிக சாத்தியமானது/அடிக்கடி தோன்றுவது என்றால், அதற்கு ஒதுக்கப்படும் டோக்கன் எண் குறைவாக இருக்கும்:

  • முற்றுப்புள்ளிக்காக உருவாக்கப்படும் டோக்கன் மூன்று வாக்கியங்களிலும் ஒரே மாதிரி (“13”) உள்ளது. இதற்குக் காரணம், சூழல்படி, கார்ப்பஸ் தரவெங்கும் முற்றுப்புள்ளி மிகவும் ஒத்த முறையில் பயன்படுத்தப்படுகிறது.

  • ‘red’ க்காக உருவாக்கப்படும் டோக்கன், வாக்கியத்தில் அதன் இடத்தைப் பொறுத்து மாறுபடும்:

    • வாக்கியத்தின் நடுவில் சிறிய எழுத்து: ‘ red’ - (டோக்கன்: “2266”)

    • வாக்கியத்தின் நடுவில் பெரிய எழுத்து: ‘ Red’ - (டோக்கன்: “2297”)

    • வாக்கியத்தின் தொடக்கத்தில் பெரிய எழுத்து: ‘Red’ - (டோக்கன்: “7738”)

இந்தக் கட்டுரை உங்களுக்கு உதவியாக இருந்ததா?