ടോക്കണുകൾ എന്താണ്?
OpenAI മോഡലുകൾ പ്രോസസ്സ് ചെയ്യുന്ന ടെക്സ്റ്റിന്റെ അടിസ്ഥാന ഘടകങ്ങളാണ് ടോക്കണുകൾ. ഭാഷയും സന്ദർഭവും അനുസരിച്ച് അവയ്ക്ക് ഒരൊറ്റ അക്ഷരംപോലെ ചെറുതോ ഒരു പൂർണവാക്കുപോലെ വലുതോ ആകാം. സ്പേസുകൾ, വിരാമചിഹ്നങ്ങൾ, വാക്കുകളുടെ ഭാഗങ്ങൾ എന്നിവയെല്ലാം ടോക്കൺ എണ്ണത്തിൽ ഉൾപ്പെടുന്നു. മറുപടി സൃഷ്ടിക്കുന്നതിന് മുമ്പ് API നിങ്ങളുടെ ടെക്സ്റ്റിനെ ആന്തരികമായി ഇങ്ങനെയാണ് വിഭജിക്കുന്നത്.
ഇംഗ്ലീഷിനുള്ള ഉപകാരപ്രദമായ ഏകദേശ കണക്കുകൾ:
1 ടോക്കൺ ≈ 4 അക്ഷരങ്ങൾ
1 ടോക്കൺ ≈ ഒരു വാക്കിന്റെ ¾ ഭാഗം
100 ടോക്കണുകൾ ≈ 75 വാക്കുകൾ
1–2 വാക്യങ്ങൾ ≈ 30 ടോക്കണുകൾ
1 ഖണ്ഡിക ≈ 100 ടോക്കണുകൾ
~1,500 വാക്കുകൾ ≈ 2,048 ടോക്കണുകൾ
മോഡലും എൻകോഡിങ്ങും അനുസരിച്ച് ടോക്കനൈസേഷൻ വ്യത്യാസപ്പെടുന്നു. നിങ്ങൾ ലക്ഷ്യമിടുന്ന മോഡലിന്റെ കൃത്യമായ എണ്ണം കണ്ടെത്താൻ ടോക്കനൈസർ ഉപകരണമോ tiktoken.encoding_for_model(model) എന്നതോ ഉപയോഗിക്കുക.
ഉദാഹരണങ്ങൾ
ഏകദേശ ടോക്കൺ എണ്ണത്തോടുകൂടിയ യഥാർഥ സാഹചര്യങ്ങളിൽനിന്നുള്ള ചില ടെക്സ്റ്റ് ഉദാഹരണങ്ങൾ ഇതാ:
വെയ്ൻ ഗ്രെറ്റ്സ്കിയുടെ “നിങ്ങൾ ശ്രമിക്കാത്ത ഷോട്ടുകളിൽ 100% ഉം നഷ്ടപ്പെടുത്തുന്നു” എന്ന ഉദ്ധരണി = 11 ടോക്കണുകൾ
OpenAI ചാർട്ടർ = 476 ടോക്കണുകൾ
യുഎസ് സ്വാതന്ത്ര്യപ്രഖ്യാപനം = 1,695 ടോക്കണുകൾ
ടോക്കൺ എണ്ണം കണക്കാക്കുന്ന വിധം
നിങ്ങൾ API-യിലേക്ക് ടെക്സ്റ്റ് അയയ്ക്കുമ്പോൾ:
ടെക്സ്റ്റ് ടോക്കണുകളായി വിഭജിക്കുന്നു.
മോഡൽ ഈ ടോക്കണുകൾ പ്രോസസ്സ് ചെയ്യുന്നു.
ടോക്കണുകളുടെ ഒരു ശ്രേണിയായി മറുപടി സൃഷ്ടിച്ചശേഷം അതിനെ വീണ്ടും ടെക്സ്റ്റാക്കി മാറ്റുന്നു.
ടോക്കൺ ഉപയോഗം വിവിധ വിഭാഗങ്ങളിലായി രേഖപ്പെടുത്തുന്നു:
ഇൻപുട്ട് ടോക്കണുകൾ – നിങ്ങളുടെ അഭ്യർഥനയിലെ ടോക്കണുകൾ.
ഔട്ട്പുട്ട് ടോക്കണുകൾ – മറുപടിയിൽ സൃഷ്ടിക്കുന്ന ടോക്കണുകൾ.
കാഷ് ചെയ്ത ടോക്കണുകൾ – സംഭാഷണചരിത്രത്തിൽ വീണ്ടും ഉപയോഗിക്കുന്ന ടോക്കണുകൾ. ഇവയ്ക്ക് പലപ്പോഴും കുറഞ്ഞ നിരക്കാണ് ഈടാക്കുന്നത്.
റീസണിംഗ് ടോക്കണുകൾ – ചില നൂതന മോഡലുകളിൽ അന്തിമ ഔട്ട്പുട്ട് സൃഷ്ടിക്കുന്നതിന് മുമ്പ് അധിക “ചിന്താഘട്ടങ്ങൾ” ആന്തരികമായി ഉൾപ്പെടുത്തുന്നു.
ഈ കണക്കുകൾ നിങ്ങളുടെ API മറുപടിയുടെ മെറ്റാഡാറ്റയിൽ പ്രത്യക്ഷപ്പെടുകയും ബില്ലിങ്ങിനും ഉപയോഗം നിരീക്ഷിക്കാനും ഉപയോഗിക്കുകയും ചെയ്യുന്നു.
ടോക്കനൈസേഷൻ കൂടുതൽ വിശദമായി മനസ്സിലാക്കാൻ ഞങ്ങളുടെ സംവേദനാത്മക ടോക്കനൈസർ ഉപകരണം ഉപയോഗിക്കാം. ഇത് ടോക്കണുകളുടെ എണ്ണം കണക്കാക്കാനും ടെക്സ്റ്റ് എങ്ങനെ ടോക്കണുകളായി വിഭജിക്കുന്നുവെന്ന് കാണാനും സഹായിക്കുന്നു.
പകരമായി, പ്രോഗ്രാമിലൂടെ ടെക്സ്റ്റ് ടോക്കനൈസ് ചെയ്യണമെങ്കിൽ, OpenAI മോഡലുകൾക്കായി പ്രത്യേകം ഉപയോഗിക്കുന്ന വേഗമേറിയ BPE ടോക്കനൈസറായ Tiktoken ഉപയോഗിക്കുക.
ടോക്കൺ പരിധികൾ
ഓരോ മോഡലിനും ഇൻപുട്ടും ഔട്ട്പുട്ടും ചേർന്ന പരമാവധി ടോക്കൺ പരിധിയുണ്ട്. നിലവിലെ ഉയർന്ന ശേഷിയുള്ള മോഡലുകൾ സന്ദർഭത്തിൽ ലക്ഷക്കണക്കിന് ടോക്കണുകൾ വരെ പിന്തുണയ്ക്കുന്നു. എന്നാൽ മോഡൽ പതിപ്പും നിങ്ങളുടെ ഉപയോഗനിലയും അനുസരിച്ച് പ്രായോഗിക പരിധികൾ വ്യത്യാസപ്പെടാം.
പരിധി കവിഞ്ഞാൽ നിങ്ങൾക്ക് ഇവ ചെയ്യാം:
പ്രോംപ്റ്റുകൾ ചുരുക്കുകയോ മറ്റൊരു രീതിയിൽ എഴുതുകയോ ചെയ്യുക.
വലിയ ടെക്സ്റ്റിനെ ചെറിയ ഭാഗങ്ങളായി വിഭജിക്കുക.
ഇൻപുട്ടുകൾ അയയ്ക്കുന്നതിന് മുമ്പ് അവ സംഗ്രഹിക്കുകയോ മുൻകൂട്ടി പ്രോസസ്സ് ചെയ്യുകയോ ചെയ്യുക.
ടോക്കൺ നിരക്കുകൾ
മോഡലിനെയും ടോക്കണുകൾ ഇൻപുട്ടാണോ ഔട്ട്പുട്ടാണോ കാഷ് ചെയ്തതാണോ എന്നതിനെയും ആശ്രയിച്ച്, ഓരോ ടോക്കണിനും API ഉപയോഗനിരക്ക് നിശ്ചയിക്കുന്നു. നിലവിലെ നിരക്കുകൾക്ക് OpenAI-യുടെ നിരക്കുകളുടെ പേജ് കാണുക. ചില റീസണിംഗ് മോഡലുകൾ ആന്തരികമായി കൂടുതൽ ടോക്കണുകൾ ഉപയോഗിച്ചേക്കാം. എന്നാൽ പൂർത്തിയാക്കുന്ന ഓരോ ജോലിക്കും വേണ്ട ടോക്കണുകളുടെ എണ്ണം കുറച്ച് കാര്യക്ഷമത മെച്ചപ്പെടുത്തുകയാണ് അവയുടെ ലക്ഷ്യം.
AI മോഡലുകൾക്കും ദാതാക്കൾക്കുമിടയിൽ ടോക്കണുകൾക്ക് ഏകീകൃത മാനദണ്ഡമില്ല. ഒരേ ടെക്സ്റ്റ് പ്രോസസ്സ് ചെയ്യാനോ സൃഷ്ടിക്കാനോ വ്യത്യസ്ത മോഡലുകൾ വ്യത്യസ്ത എണ്ണം ടോക്കണുകൾ ഉപയോഗിച്ചേക്കാം. അതിനാൽ പത്ത് ലക്ഷം ടോക്കണുകൾക്ക് പരസ്യപ്പെടുത്തുന്ന കുറഞ്ഞ നിരക്ക്, മൊത്തം ചെലവും കുറവായിരിക്കുമെന്ന് നിർബന്ധമില്ല.
ദൃശ്യമാകുന്ന മറുപടിയുടെ നീളം മാത്രം പൂർണചിത്രം നൽകുന്നില്ല. ചില മോഡലുകൾ മറുപടി നൽകുന്നതിന് മുമ്പ് ആന്തരികമായി റീസണിംഗ് ടോക്കണുകൾ ഉപയോഗിക്കുന്നു. അതിനാൽ ദൃശ്യമാകുന്ന മറുപടി നീളമുള്ളതാണെന്നത് മോഡൽ മൊത്തത്തിൽ കൂടുതൽ ടോക്കണുകൾ ഉപയോഗിച്ചുവെന്ന് നിർബന്ധമായും അർത്ഥമാക്കുന്നില്ല.
മോഡലുകൾ താരതമ്യം ചെയ്യുമ്പോൾ, ആവശ്യമായ മൊത്തം ടോക്കണുകളുടെ എണ്ണവും വിജയകരമായ ഓരോ ഫലത്തിനുമുള്ള ചെലവും പരിഗണിക്കുക. മാനദണ്ഡപരിശോധനകൾ ഉപകാരപ്രദമായ ഒരു തുടക്കമാകാം. എന്നാൽ നിങ്ങളുടെ സ്വന്തം ഉപയോഗസാഹചര്യങ്ങളിൽ മോഡലുകൾ പരീക്ഷിക്കുന്നതാണ് അവയുടെ യഥാർഥ ചെലവും പ്രകടനവും മനസ്സിലാക്കാനുള്ള മികച്ച മാർഗം.
ടോക്കണുകളെക്കുറിച്ച് അറിയുക
കോർപ്പസ് ഡാറ്റയിലെ സന്ദർഭത്തിന് അനുസരിച്ചാണ് API വാക്കുകളെ കൈകാര്യം ചെയ്യുന്നത്. മോഡലുകൾ പ്രോംപ്റ്റ് സ്വീകരിച്ച് ഇൻപുട്ടിനെ ടോക്കണുകളുടെ പട്ടികയാക്കി മാറ്റുകയും പ്രോംപ്റ്റ് പ്രോസസ്സ് ചെയ്യുകയും പ്രവചിച്ച ടോക്കണുകളെ മറുപടിയിൽ കാണുന്ന വാക്കുകളാക്കി തിരികെ മാറ്റുകയും ചെയ്യുന്നു.
നമുക്ക് ഒരുപോലെ തോന്നുന്ന രണ്ട് വാക്കുകൾ, ടെക്സ്റ്റിനുള്ളിലെ അവയുടെ ഘടന അനുസരിച്ച് വ്യത്യസ്ത ടോക്കണുകളായി സൃഷ്ടിക്കപ്പെട്ടേക്കാം. ടെക്സ്റ്റിനുള്ളിലെ സന്ദർഭത്തെ അടിസ്ഥാനമാക്കി API ‘red’ എന്ന വാക്കിന് ടോക്കൺ മൂല്യങ്ങൾ സൃഷ്ടിക്കുന്നത് എങ്ങനെയെന്ന് നോക്കുക:
മുകളിലെ ആദ്യ ഉദാഹരണത്തിൽ ‘ red’ എന്നതിനുള്ള “2266” എന്ന ടോക്കണിൽ അവസാനത്തെ സ്പേസ് ഉൾപ്പെടുന്നു. ഇവ വിശദീകരണത്തിനായി നൽകിയ ഉദാഹരണ ടോക്കൺ ഐഡികളാണെന്നത് ശ്രദ്ധിക്കുക.
‘ Red’ എന്നതിനുള്ള “2296” എന്ന ടോക്കൺ, ചെറിയക്ഷരത്തിലുള്ള ‘ red’ എന്നതിനുള്ള “2266” എന്ന ടോക്കണിൽനിന്ന് വ്യത്യസ്തമാണ്. ആദ്യത്തേതിന് തുടക്കത്തിൽ സ്പേസും വലിയക്ഷരവുമുണ്ട്.
‘Red’ ഒരു വാക്യത്തിന്റെ തുടക്കത്തിൽ ഉപയോഗിക്കുമ്പോൾ, സൃഷ്ടിക്കുന്ന ടോക്കണിൽ തുടക്കത്തിലെ സ്പേസ് ഉൾപ്പെടുന്നില്ല. “7738” എന്ന ടോക്കൺ, ഈ വാക്കിന്റെ മുമ്പത്തെ രണ്ട് ഉദാഹരണങ്ങളിൽനിന്നും വ്യത്യസ്തമാണ്.
നിരീക്ഷണങ്ങൾ:
ഒരു ടോക്കൺ കൂടുതൽ സാധ്യതയുള്ളതോ പതിവായി ഉപയോഗിക്കുന്നതോ ആണെങ്കിൽ, അതിന് നൽകുന്ന ടോക്കൺ സംഖ്യ കുറവായിരിക്കും:
പൂർണവിരാമത്തിന് സൃഷ്ടിച്ച ടോക്കൺ മൂന്ന് വാക്യങ്ങളിലും ഒന്നുതന്നെയാണ്, അതായത് “13”. കോർപ്പസ് ഡാറ്റയിലുടനീളം പൂർണവിരാമം സന്ദർഭപരമായി ഏറെക്കുറെ ഒരേ രീതിയിൽ ഉപയോഗിക്കുന്നതിനാലാണിത്.
വാക്യത്തിൽ ‘red’ വരുന്ന സ്ഥാനത്തിന് അനുസരിച്ച് അതിനായി സൃഷ്ടിക്കുന്ന ടോക്കൺ വ്യത്യാസപ്പെടുന്നു:
വാക്യത്തിന്റെ മധ്യത്തിൽ ചെറിയക്ഷരത്തിൽ: ‘ red’ - (ടോക്കൺ: “2266”)
വാക്യത്തിന്റെ മധ്യത്തിൽ വലിയക്ഷരത്തിൽ: ‘ Red’ - (ടോക്കൺ: “2297”)
വാക്യത്തിന്റെ തുടക്കത്തിൽ വലിയക്ഷരത്തിൽ: ‘Red’ - (ടോക്കൺ: “7738”)
