ടോക്കണുകൾ എന്താണ്?
OpenAI മോഡലുകൾ പ്രോസസ് ചെയ്യുന്ന ടെക്സ്റ്റിന്റെ അടിസ്ഥാന ഘടകങ്ങളാണ് ടോക്കണുകൾ. ഭാഷയും സന്ദർഭവും അനുസരിച്ച് അവ ഒറ്റ കഥാപാത്രം പോലെ ചെറുതോ ഒരു പൂർണ്ണ വാക്ക് പോലെ ദൈർഘ്യമുള്ളതോ ആയിരിക്കാം. സ്പേസുകൾ, ചിഹ്നങ്ങൾ, ഭാഗിക വാക്കുകൾ എന്നിവയെല്ലാം ടോക്കൺ എണ്ണത്തിൽ ഉൾപ്പെടുന്നു. ഒരു പ്രതികരണം സൃഷ്ടിക്കുന്നതിന് മുമ്പ് API നിങ്ങളുടെ ടെക്സ്റ്റിനെ ആന്തരികമായി വിഭജിക്കുന്ന രീതി ഇതാണ്.
ഇംഗ്ലീഷിനുള്ള സഹായകരമായ പൊതുവായ നിയമങ്ങൾ:
1 ടോക്കൺ ≈ 4 അക്ഷരങ്ങൾ
1 ടോക്കൺ ≈ ഒരു വാക്കിന്റെ ¾
100 ടോക്കണുകൾ ≈ 75 വാക്കുകൾ
1–2 വാക്യങ്ങൾ ≈ 30 ടോക്കണുകൾ
1 ഖണ്ഡിക ≈ 100 ടോക്കണുകൾ
~1,500 വാക്കുകൾ ≈ 2,048 ടോക്കണുകൾ
മോഡലും എൻകോഡിംഗും അനുസരിച്ച് ടോക്കനൈസേഷൻ മാറും. നിങ്ങളുടെ ലക്ഷ്യ മോഡലിനുള്ള കൃത്യമായ എണ്ണം ലഭിക്കാൻ ടോക്കനൈസർ ടൂൾ അല്ലെങ്കിൽ tiktoken.encoding_for_model(model) ഉപയോഗിക്കുക.
ഉദാഹരണങ്ങൾ
അവയുടെ ഏകദേശ ടോക്കൺ എണ്ണങ്ങളോടുകൂടിയ ചില യഥാർത്ഥ ടെക്സ്റ്റ് സാമ്പിളുകൾ ഇവിടെയുണ്ട്:
Wayne Gretzky-യുടെ ഉദ്ധരണി “നിങ്ങൾ എടുക്കാത്ത ഷോട്ടുകളുടെ 100% നിങ്ങൾ നഷ്ടപ്പെടുത്തുന്നു” = 11 ടോക്കണുകൾ
OpenAI ചാർട്ടർ = 476 ടോക്കണുകൾ
യുഎസ് സ്വാതന്ത്ര്യ പ്രഖ്യാപനം = 1,695 ടോക്കണുകൾ
ടോക്കൺ എണ്ണങ്ങൾ എങ്ങനെ കണക്കാക്കുന്നു
നിങ്ങൾ API-യിലേക്ക് ടെക്സ്റ്റ് അയയ്ക്കുമ്പോൾ:
ടെക്സ്റ്റ് ടോക്കണുകളായി വിഭജിക്കപ്പെടുന്നു.
മോഡൽ ഈ ടോക്കണുകൾ പ്രോസസ് ചെയ്യുന്നു.
പ്രതികരണം ടോക്കണുകളുടെ ഒരു ശ്രേണിയായി സൃഷ്ടിക്കപ്പെടുകയും തുടർന്ന് വീണ്ടും ടെക്സ്റ്റായി മാറ്റപ്പെടുകയും ചെയ്യുന്നു.
ടോക്കൺ ഉപയോഗം പല വിഭാഗങ്ങളിലായി ട്രാക്ക് ചെയ്യപ്പെടുന്നു:
ഇൻപുട്ട് ടോക്കണുകൾ – നിങ്ങളുടെ അഭ്യർത്ഥനയിലെ ടോക്കണുകൾ.
ഔട്ട്പുട്ട് ടോക്കണുകൾ – പ്രതികരണത്തിൽ സൃഷ്ടിക്കപ്പെട്ട ടോക്കണുകൾ.
കാഷ് ചെയ്ത ടോക്കണുകൾ – സംഭാഷണ ചരിത്രത്തിൽ വീണ്ടും ഉപയോഗിച്ച ടോക്കണുകൾ (പലപ്പോഴും കുറഞ്ഞ നിരക്കിൽ ബിൽ ചെയ്യപ്പെടും).
റീസണിംഗ് ടോക്കണുകൾ – ചില പുരോഗമിച്ച മോഡലുകളിൽ, അന്തിമ ഔട്ട്പുട്ട് സൃഷ്ടിക്കുന്നതിന് മുമ്പ് അധിക “ചിന്താ ഘട്ടങ്ങൾ” ആന്തരികമായി ഉൾപ്പെടുന്നു.
ഈ എണ്ണങ്ങൾ നിങ്ങളുടെ API പ്രതികരണ മെറ്റാഡാറ്റയിൽ കാണപ്പെടുകയും ബില്ലിംഗിനും ഉപയോഗ ട്രാക്കിംഗിനും ഉപയോഗിക്കപ്പെടുകയും ചെയ്യുന്നു.
ടോക്കനൈസേഷൻ കൂടുതൽ പരിശോധിക്കാൻ, ടോക്കണുകളുടെ എണ്ണം കണക്കാക്കാനും ടെക്സ്റ്റ് ടോക്കണുകളായി എങ്ങനെ വിഭജിക്കപ്പെടുന്നു എന്ന് കാണാനും അനുവദിക്കുന്ന ഞങ്ങളുടെ ഇന്ററാക്ടീവ് ടോക്കനൈസർ ടൂൾ ഉപയോഗിക്കാം.
മാറ്റമായി, നിങ്ങൾക്ക് പ്രോഗ്രാമാറ്റിക്കായി ടെക്സ്റ്റ് ടോക്കനൈസ് ചെയ്യാൻ ആഗ്രഹമുണ്ടെങ്കിൽ, OpenAI മോഡലുകൾക്കായി പ്രത്യേകമായി ഉപയോഗിക്കുന്ന വേഗത്തിലുള്ള BPE ടോക്കനൈസറായി Tiktoken ഉപയോഗിക്കുക.
ടോക്കൺ പരിധികൾ
ഓരോ മോഡലിനും പരമാവധി സംയോജിത ടോക്കൺ പരിധി (ഇൻപുട്ട് + ഔട്ട്പുട്ട്) ഉണ്ട്. നിലവിലെ ഉയർന്ന ശേഷിയുള്ള മോഡലുകൾ സന്ദർഭത്തിൽ ലക്ഷക്കണക്കിന് ടോക്കണുകൾ വരെ പിന്തുണയ്ക്കുന്നു, എങ്കിലും പ്രായോഗിക പരിധികൾ മോഡൽ പതിപ്പിനെയും നിങ്ങളുടെ ഉപയോഗ ടിയറിനെയും ആശ്രയിച്ച് മാറാം.
നിങ്ങൾ പരിധി കവിയുകയാണെങ്കിൽ, നിങ്ങൾക്ക്:
പ്രോംപ്റ്റുകൾ ചുരുക്കുക അല്ലെങ്കിൽ വീണ്ടും രൂപപ്പെടുത്തുക.
വലിയ ടെക്സ്റ്റിനെ ചെറിയ ഭാഗങ്ങളായി വിഭജിക്കുക.
ഇൻപുട്ടുകൾ അയയ്ക്കുന്നതിന് മുമ്പ് അവ സംഗ്രഹിക്കുക അല്ലെങ്കിൽ പ്രീ-പ്രോസസ് ചെയ്യുക.
ടോക്കൺ വിലനിർണ്ണയം
API ഉപയോഗത്തിന് ഓരോ ടോക്കണിനും വിലനിർണ്ണയം ചെയ്യപ്പെടുന്നു; മോഡലിനെയും ടോക്കണുകൾ ഇൻപുട്ടാണോ, ഔട്ട്പുട്ടാണോ, കാഷ് ചെയ്തതാണോ എന്നതനുസരിച്ച് ഇത് മാറും. നിലവിലെ നിരക്കുകൾക്കായി OpenAI-യുടെ വിലനിർണ്ണയ പേജ് കാണുക. ചില റീസണിംഗ് മോഡലുകൾ ആന്തരികമായി കൂടുതൽ ടോക്കണുകൾ ഉപയോഗിച്ചേക്കാം, പക്ഷേ പൂർത്തിയാക്കിയ ഓരോ ജോലിക്കും ആവശ്യമായ ടോക്കണുകളുടെ എണ്ണം കുറച്ച് കാര്യക്ഷമത മെച്ചപ്പെടുത്തുകയാണ് ലക്ഷ്യം.
ടോക്കണുകൾ പരിശോധിക്കൽ
കോർപ്പസ് ഡാറ്റയിലെ സന്ദർഭം അനുസരിച്ച് API വാക്കുകളെ പരിഗണിക്കുന്നു. മോഡലുകൾ പ്രോംപ്റ്റ് എടുത്ത് ഇൻപുട്ടിനെ ടോക്കണുകളുടെ ഒരു പട്ടികയാക്കി മാറ്റി പ്രോംപ്റ്റ് പ്രോസസ് ചെയ്യുകയും പ്രവചിച്ച ടോക്കണുകളെ പ്രതികരണത്തിൽ നാം കാണുന്ന വാക്കുകളാക്കി വീണ്ടും മാറ്റുകയും ചെയ്യുന്നു.
നമുക്ക് ഒരേപോലെ തോന്നുന്ന രണ്ട് വാക്കുകൾ, അവ ടെക്സ്റ്റിനുള്ളിൽ എങ്ങനെ ഘടിപ്പിച്ചിരിക്കുന്നു എന്നതനുസരിച്ച് വ്യത്യസ്ത ടോക്കണുകളായി സൃഷ്ടിക്കപ്പെടാം. ടെക്സ്റ്റിനുള്ളിലെ സന്ദർഭത്തെ അടിസ്ഥാനമാക്കി ‘red’ എന്ന വാക്കിന് API ടോക്കൺ മൂല്യങ്ങൾ എങ്ങനെ സൃഷ്ടിക്കുന്നു എന്ന് പരിഗണിക്കുക:
മുകളിലെ ആദ്യ ഉദാഹരണത്തിൽ, ‘ red’ എന്നതിനുള്ള “2266” എന്ന ടോക്കണിൽ ഒരു പിറകിലെ സ്പേസ് ഉൾപ്പെടുന്നു (ശ്രദ്ധിക്കുക, ഇവ പ്രദർശന ആവശ്യങ്ങൾക്കുള്ള ഉദാഹരണ ടോക്കൺ ID-കളാണ്).
‘ Red’ എന്നതിനുള്ള “2296” എന്ന ടോക്കൺ (മുന്നിൽ സ്പേസ് ഉള്ളതും വലിയ അക്ഷരത്തിൽ തുടങ്ങുന്നതും) ചെറിയ അക്ഷരത്തിലുള്ള ‘ red’ എന്നതിനുള്ള “2266” എന്ന ടോക്കണിൽ നിന്ന് വ്യത്യസ്തമാണ്.
ഒരു വാക്യത്തിന്റെ തുടക്കത്തിൽ ‘Red’ ഉപയോഗിക്കുമ്പോൾ, സൃഷ്ടിക്കുന്ന ടോക്കണിൽ മുന്നിലെ സ്പേസ് ഉൾപ്പെടുന്നില്ല. “7738” എന്ന ടോക്കൺ ആ വാക്കിന്റെ മുൻ രണ്ട് ഉദാഹരണങ്ങളിൽ നിന്ന് വ്യത്യസ്തമാണ്.
നിരീക്ഷണങ്ങൾ:
ഒരു ടോക്കൺ കൂടുതൽ സാദ്ധ്യതയുള്ളതോ കൂടുതലായി കാണുന്നതോ ആകുമ്പോൾ, അതിന് നിയോഗിക്കുന്ന ടോക്കൺ നമ്പർ കുറവായിരിക്കും:
പൂർണ്ണവിരാമത്തിനായി സൃഷ്ടിക്കുന്ന ടോക്കൺ എല്ലാ 3 വാക്യങ്ങളിലും ഒരുപോലെയാണ് (“13”). കാരണം, സന്ദർഭപരമായി, കോർപ്പസ് ഡാറ്റയിലുടനീളം പൂർണ്ണവിരാമം ഏറെ സമാനമായ രീതിയിൽ ഉപയോഗിക്കപ്പെടുന്നു.
‘red’ എന്നതിനായി സൃഷ്ടിക്കുന്ന ടോക്കൺ വാക്യത്തിനുള്ളിലെ അതിന്റെ സ്ഥാനത്തെ ആശ്രയിച്ച് മാറും:
ഒരു വാക്യത്തിന്റെ നടുവിൽ ചെറിയ അക്ഷരത്തിൽ: ‘ red’ - (ടോക്കൺ: “2266”)
ഒരു വാക്യത്തിന്റെ നടുവിൽ വലിയ അക്ഷരത്തിൽ: ‘ Red’ - (ടോക്കൺ: “2297”)
ഒരു വാക്യത്തിന്റെ തുടക്കത്തിൽ വലിയ അക്ഷരത്തിൽ: ‘Red’ - (ടോക്കൺ: “7738”)
