OpenAI
ഈ പേജ് യന്ത്രസഹായത്താൽ വിവർത്തനം ചെയ്തത് ആണ്. യഥാർത്ഥ ഇംഗ്ലീഷ് ലേഖനം കാണുക.

ടോക്കണുകൾ എന്താണ്, അവ എങ്ങനെ എണ്ണാം?

അപ്‌ഡേറ്റ് ചെയ്തത്: 8 days ago.

ടോക്കണുകൾ എന്താണ്?

OpenAI മോഡലുകൾ പ്രോസസ് ചെയ്യുന്ന ടെക്സ്റ്റിന്റെ അടിസ്ഥാന ഘടകങ്ങളാണ് ടോക്കണുകൾ. ഭാഷയും സന്ദർഭവും അനുസരിച്ച് അവ ഒറ്റ കഥാപാത്രം പോലെ ചെറുതോ ഒരു പൂർണ്ണ വാക്ക് പോലെ ദൈർഘ്യമുള്ളതോ ആയിരിക്കാം. സ്പേസുകൾ, ചിഹ്നങ്ങൾ, ഭാഗിക വാക്കുകൾ എന്നിവയെല്ലാം ടോക്കൺ എണ്ണത്തിൽ ഉൾപ്പെടുന്നു. ഒരു പ്രതികരണം സൃഷ്ടിക്കുന്നതിന് മുമ്പ് API നിങ്ങളുടെ ടെക്സ്റ്റിനെ ആന്തരികമായി വിഭജിക്കുന്ന രീതി ഇതാണ്.

ഇംഗ്ലീഷിനുള്ള സഹായകരമായ പൊതുവായ നിയമങ്ങൾ:

  • 1 ടോക്കൺ ≈ 4 അക്ഷരങ്ങൾ

  • 1 ടോക്കൺ ≈ ഒരു വാക്കിന്റെ ¾

  • 100 ടോക്കണുകൾ ≈ 75 വാക്കുകൾ

  • 1–2 വാക്യങ്ങൾ ≈ 30 ടോക്കണുകൾ

  • 1 ഖണ്ഡിക ≈ 100 ടോക്കണുകൾ

  • ~1,500 വാക്കുകൾ ≈ 2,048 ടോക്കണുകൾ

മോഡലും എൻകോഡിംഗും അനുസരിച്ച് ടോക്കനൈസേഷൻ മാറും. നിങ്ങളുടെ ലക്ഷ്യ മോഡലിനുള്ള കൃത്യമായ എണ്ണം ലഭിക്കാൻ ടോക്കനൈസർ ടൂൾ അല്ലെങ്കിൽ tiktoken.encoding_for_model(model) ഉപയോഗിക്കുക.

ഉദാഹരണങ്ങൾ

അവയുടെ ഏകദേശ ടോക്കൺ എണ്ണങ്ങളോടുകൂടിയ ചില യഥാർത്ഥ ടെക്സ്റ്റ് സാമ്പിളുകൾ ഇവിടെയുണ്ട്:

  • Wayne Gretzky-യുടെ ഉദ്ധരണി “നിങ്ങൾ എടുക്കാത്ത ഷോട്ടുകളുടെ 100% നിങ്ങൾ നഷ്ടപ്പെടുത്തുന്നു” = 11 ടോക്കണുകൾ

  • OpenAI ചാർട്ടർ = 476 ടോക്കണുകൾ

  • യുഎസ് സ്വാതന്ത്ര്യ പ്രഖ്യാപനം = 1,695 ടോക്കണുകൾ

ടോക്കൺ എണ്ണങ്ങൾ എങ്ങനെ കണക്കാക്കുന്നു

നിങ്ങൾ API-യിലേക്ക് ടെക്സ്റ്റ് അയയ്ക്കുമ്പോൾ:

  1. ടെക്സ്റ്റ് ടോക്കണുകളായി വിഭജിക്കപ്പെടുന്നു.

  2. മോഡൽ ഈ ടോക്കണുകൾ പ്രോസസ് ചെയ്യുന്നു.

  3. പ്രതികരണം ടോക്കണുകളുടെ ഒരു ശ്രേണിയായി സൃഷ്ടിക്കപ്പെടുകയും തുടർന്ന് വീണ്ടും ടെക്സ്റ്റായി മാറ്റപ്പെടുകയും ചെയ്യുന്നു.

ടോക്കൺ ഉപയോഗം പല വിഭാഗങ്ങളിലായി ട്രാക്ക് ചെയ്യപ്പെടുന്നു:

  • ഇൻപുട്ട് ടോക്കണുകൾ – നിങ്ങളുടെ അഭ്യർത്ഥനയിലെ ടോക്കണുകൾ.

  • ഔട്ട്പുട്ട് ടോക്കണുകൾ – പ്രതികരണത്തിൽ സൃഷ്ടിക്കപ്പെട്ട ടോക്കണുകൾ.

  • കാഷ് ചെയ്ത ടോക്കണുകൾ – സംഭാഷണ ചരിത്രത്തിൽ വീണ്ടും ഉപയോഗിച്ച ടോക്കണുകൾ (പലപ്പോഴും കുറഞ്ഞ നിരക്കിൽ ബിൽ ചെയ്യപ്പെടും).

  • റീസണിംഗ് ടോക്കണുകൾ – ചില പുരോഗമിച്ച മോഡലുകളിൽ, അന്തിമ ഔട്ട്പുട്ട് സൃഷ്ടിക്കുന്നതിന് മുമ്പ് അധിക “ചിന്താ ഘട്ടങ്ങൾ” ആന്തരികമായി ഉൾപ്പെടുന്നു.

ഈ എണ്ണങ്ങൾ നിങ്ങളുടെ API പ്രതികരണ മെറ്റാഡാറ്റയിൽ കാണപ്പെടുകയും ബില്ലിംഗിനും ഉപയോഗ ട്രാക്കിംഗിനും ഉപയോഗിക്കപ്പെടുകയും ചെയ്യുന്നു.

ടോക്കനൈസേഷൻ കൂടുതൽ പരിശോധിക്കാൻ, ടോക്കണുകളുടെ എണ്ണം കണക്കാക്കാനും ടെക്സ്റ്റ് ടോക്കണുകളായി എങ്ങനെ വിഭജിക്കപ്പെടുന്നു എന്ന് കാണാനും അനുവദിക്കുന്ന ഞങ്ങളുടെ ഇന്ററാക്ടീവ് ടോക്കനൈസർ ടൂൾ ഉപയോഗിക്കാം.

മാറ്റമായി, നിങ്ങൾക്ക് പ്രോഗ്രാമാറ്റിക്കായി ടെക്സ്റ്റ് ടോക്കനൈസ് ചെയ്യാൻ ആഗ്രഹമുണ്ടെങ്കിൽ, OpenAI മോഡലുകൾക്കായി പ്രത്യേകമായി ഉപയോഗിക്കുന്ന വേഗത്തിലുള്ള BPE ടോക്കനൈസറായി Tiktoken ഉപയോഗിക്കുക.

ടോക്കൺ പരിധികൾ

ഓരോ മോഡലിനും പരമാവധി സംയോജിത ടോക്കൺ പരിധി (ഇൻപുട്ട് + ഔട്ട്പുട്ട്) ഉണ്ട്. നിലവിലെ ഉയർന്ന ശേഷിയുള്ള മോഡലുകൾ സന്ദർഭത്തിൽ ലക്ഷക്കണക്കിന് ടോക്കണുകൾ വരെ പിന്തുണയ്ക്കുന്നു, എങ്കിലും പ്രായോഗിക പരിധികൾ മോഡൽ പതിപ്പിനെയും നിങ്ങളുടെ ഉപയോഗ ടിയറിനെയും ആശ്രയിച്ച് മാറാം.

നിങ്ങൾ പരിധി കവിയുകയാണെങ്കിൽ, നിങ്ങൾക്ക്:

  • പ്രോംപ്റ്റുകൾ ചുരുക്കുക അല്ലെങ്കിൽ വീണ്ടും രൂപപ്പെടുത്തുക.

  • വലിയ ടെക്സ്റ്റിനെ ചെറിയ ഭാഗങ്ങളായി വിഭജിക്കുക.

  • ഇൻപുട്ടുകൾ അയയ്ക്കുന്നതിന് മുമ്പ് അവ സംഗ്രഹിക്കുക അല്ലെങ്കിൽ പ്രീ-പ്രോസസ് ചെയ്യുക.

ടോക്കൺ വിലനിർണ്ണയം

API ഉപയോഗത്തിന് ഓരോ ടോക്കണിനും വിലനിർണ്ണയം ചെയ്യപ്പെടുന്നു; മോഡലിനെയും ടോക്കണുകൾ ഇൻപുട്ടാണോ, ഔട്ട്പുട്ടാണോ, കാഷ് ചെയ്തതാണോ എന്നതനുസരിച്ച് ഇത് മാറും. നിലവിലെ നിരക്കുകൾക്കായി OpenAI-യുടെ വിലനിർണ്ണയ പേജ് കാണുക. ചില റീസണിംഗ് മോഡലുകൾ ആന്തരികമായി കൂടുതൽ ടോക്കണുകൾ ഉപയോഗിച്ചേക്കാം, പക്ഷേ പൂർത്തിയാക്കിയ ഓരോ ജോലിക്കും ആവശ്യമായ ടോക്കണുകളുടെ എണ്ണം കുറച്ച് കാര്യക്ഷമത മെച്ചപ്പെടുത്തുകയാണ് ലക്ഷ്യം.

ടോക്കണുകൾ പരിശോധിക്കൽ

കോർപ്പസ് ഡാറ്റയിലെ സന്ദർഭം അനുസരിച്ച് API വാക്കുകളെ പരിഗണിക്കുന്നു. മോഡലുകൾ പ്രോംപ്റ്റ് എടുത്ത് ഇൻപുട്ടിനെ ടോക്കണുകളുടെ ഒരു പട്ടികയാക്കി മാറ്റി പ്രോംപ്റ്റ് പ്രോസസ് ചെയ്യുകയും പ്രവചിച്ച ടോക്കണുകളെ പ്രതികരണത്തിൽ നാം കാണുന്ന വാക്കുകളാക്കി വീണ്ടും മാറ്റുകയും ചെയ്യുന്നു.

നമുക്ക് ഒരേപോലെ തോന്നുന്ന രണ്ട് വാക്കുകൾ, അവ ടെക്സ്റ്റിനുള്ളിൽ എങ്ങനെ ഘടിപ്പിച്ചിരിക്കുന്നു എന്നതനുസരിച്ച് വ്യത്യസ്ത ടോക്കണുകളായി സൃഷ്ടിക്കപ്പെടാം. ടെക്സ്റ്റിനുള്ളിലെ സന്ദർഭത്തെ അടിസ്ഥാനമാക്കി ‘red’ എന്ന വാക്കിന് API ടോക്കൺ മൂല്യങ്ങൾ എങ്ങനെ സൃഷ്ടിക്കുന്നു എന്ന് പരിഗണിക്കുക:

Sentence split into color-coded tokens with Text selected over Token IDs
Token ID output as a list of integers with the Token IDs tab selected

മുകളിലെ ആദ്യ ഉദാഹരണത്തിൽ, ‘ red’ എന്നതിനുള്ള “2266” എന്ന ടോക്കണിൽ ഒരു പിറകിലെ സ്പേസ് ഉൾപ്പെടുന്നു (ശ്രദ്ധിക്കുക, ഇവ പ്രദർശന ആവശ്യങ്ങൾക്കുള്ള ഉദാഹരണ ടോക്കൺ ID-കളാണ്).

Sentence split into color-coded token blocks: My favorite color is Red.
Tokenizer output with Token IDs selected and a list of numeric token IDs

‘ Red’ എന്നതിനുള്ള “2296” എന്ന ടോക്കൺ (മുന്നിൽ സ്പേസ് ഉള്ളതും വലിയ അക്ഷരത്തിൽ തുടങ്ങുന്നതും) ചെറിയ അക്ഷരത്തിലുള്ള ‘ red’ എന്നതിനുള്ള “2266” എന്ന ടോക്കണിൽ നിന്ന് വ്യത്യസ്തമാണ്.

Tokenizer example splitting “Red is my favorite color.” into color-coded tokens
Tokenizer output with Token IDs selected and a list of token ID numbers

ഒരു വാക്യത്തിന്റെ തുടക്കത്തിൽ ‘Red’ ഉപയോഗിക്കുമ്പോൾ, സൃഷ്ടിക്കുന്ന ടോക്കണിൽ മുന്നിലെ സ്പേസ് ഉൾപ്പെടുന്നില്ല. “7738” എന്ന ടോക്കൺ ആ വാക്കിന്റെ മുൻ രണ്ട് ഉദാഹരണങ്ങളിൽ നിന്ന് വ്യത്യസ്തമാണ്.

നിരീക്ഷണങ്ങൾ:

ഒരു ടോക്കൺ കൂടുതൽ സാദ്ധ്യതയുള്ളതോ കൂടുതലായി കാണുന്നതോ ആകുമ്പോൾ, അതിന് നിയോഗിക്കുന്ന ടോക്കൺ നമ്പർ കുറവായിരിക്കും:

  • പൂർണ്ണവിരാമത്തിനായി സൃഷ്ടിക്കുന്ന ടോക്കൺ എല്ലാ 3 വാക്യങ്ങളിലും ഒരുപോലെയാണ് (“13”). കാരണം, സന്ദർഭപരമായി, കോർപ്പസ് ഡാറ്റയിലുടനീളം പൂർണ്ണവിരാമം ഏറെ സമാനമായ രീതിയിൽ ഉപയോഗിക്കപ്പെടുന്നു.

  • ‘red’ എന്നതിനായി സൃഷ്ടിക്കുന്ന ടോക്കൺ വാക്യത്തിനുള്ളിലെ അതിന്റെ സ്ഥാനത്തെ ആശ്രയിച്ച് മാറും:

    • ഒരു വാക്യത്തിന്റെ നടുവിൽ ചെറിയ അക്ഷരത്തിൽ: ‘ red’ - (ടോക്കൺ: “2266”)

    • ഒരു വാക്യത്തിന്റെ നടുവിൽ വലിയ അക്ഷരത്തിൽ: ‘ Red’ - (ടോക്കൺ: “2297”)

    • ഒരു വാക്യത്തിന്റെ തുടക്കത്തിൽ വലിയ അക്ഷരത്തിൽ: ‘Red’ - (ടോക്കൺ: “7738”)

ഈ ലേഖനം ഉപകാരപ്രദമായിരുന്നോ?