OpenAI
ഈ പേജ് യന്ത്രസഹായത്താൽ വിവർത്തനം ചെയ്തത് ആണ്. യഥാർത്ഥ ഇംഗ്ലീഷ് ലേഖനം കാണുക.

ടോക്കണുകൾ എന്താണ്, അവ എങ്ങനെ എണ്ണാം?

OpenAI മോഡലുകൾ ടോക്കണുകൾ എണ്ണുന്നതെങ്ങനെയെന്നും ടോക്കൺ ഉപയോഗം പരിധികളെയും API നിരക്കുകളെയും എങ്ങനെ ബാധിക്കുന്നുവെന്നും മനസ്സിലാക്കുക.

അപ്‌ഡേറ്റ് ചെയ്തത്: 34 minutes ago.

ടോക്കണുകൾ എന്താണ്?

OpenAI മോഡലുകൾ പ്രോസസ്സ് ചെയ്യുന്ന ടെക്സ്റ്റിന്റെ അടിസ്ഥാന ഘടകങ്ങളാണ് ടോക്കണുകൾ. ഭാഷയും സന്ദർഭവും അനുസരിച്ച് അവയ്ക്ക് ഒരൊറ്റ അക്ഷരംപോലെ ചെറുതോ ഒരു പൂർണവാക്കുപോലെ വലുതോ ആകാം. സ്പേസുകൾ, വിരാമചിഹ്നങ്ങൾ, വാക്കുകളുടെ ഭാഗങ്ങൾ എന്നിവയെല്ലാം ടോക്കൺ എണ്ണത്തിൽ ഉൾപ്പെടുന്നു. മറുപടി സൃഷ്ടിക്കുന്നതിന് മുമ്പ് API നിങ്ങളുടെ ടെക്സ്റ്റിനെ ആന്തരികമായി ഇങ്ങനെയാണ് വിഭജിക്കുന്നത്.

ഇംഗ്ലീഷിനുള്ള ഉപകാരപ്രദമായ ഏകദേശ കണക്കുകൾ:

  • 1 ടോക്കൺ ≈ 4 അക്ഷരങ്ങൾ

  • 1 ടോക്കൺ ≈ ഒരു വാക്കിന്റെ ¾ ഭാഗം

  • 100 ടോക്കണുകൾ ≈ 75 വാക്കുകൾ

  • 1–2 വാക്യങ്ങൾ ≈ 30 ടോക്കണുകൾ

  • 1 ഖണ്ഡിക ≈ 100 ടോക്കണുകൾ

  • ~1,500 വാക്കുകൾ ≈ 2,048 ടോക്കണുകൾ

മോഡലും എൻകോഡിങ്ങും അനുസരിച്ച് ടോക്കനൈസേഷൻ വ്യത്യാസപ്പെടുന്നു. നിങ്ങൾ ലക്ഷ്യമിടുന്ന മോഡലിന്റെ കൃത്യമായ എണ്ണം കണ്ടെത്താൻ ടോക്കനൈസർ ഉപകരണമോ tiktoken.encoding_for_model(model) എന്നതോ ഉപയോഗിക്കുക.

ഉദാഹരണങ്ങൾ

ഏകദേശ ടോക്കൺ എണ്ണത്തോടുകൂടിയ യഥാർഥ സാഹചര്യങ്ങളിൽനിന്നുള്ള ചില ടെക്സ്റ്റ് ഉദാഹരണങ്ങൾ ഇതാ:

  • വെയ്ൻ ഗ്രെറ്റ്സ്കിയുടെ “നിങ്ങൾ ശ്രമിക്കാത്ത ഷോട്ടുകളിൽ 100% ഉം നഷ്ടപ്പെടുത്തുന്നു” എന്ന ഉദ്ധരണി = 11 ടോക്കണുകൾ

  • OpenAI ചാർട്ടർ = 476 ടോക്കണുകൾ

  • യുഎസ് സ്വാതന്ത്ര്യപ്രഖ്യാപനം = 1,695 ടോക്കണുകൾ

ടോക്കൺ എണ്ണം കണക്കാക്കുന്ന വിധം

നിങ്ങൾ API-യിലേക്ക് ടെക്സ്റ്റ് അയയ്ക്കുമ്പോൾ:

  1. ടെക്സ്റ്റ് ടോക്കണുകളായി വിഭജിക്കുന്നു.

  2. മോഡൽ ഈ ടോക്കണുകൾ പ്രോസസ്സ് ചെയ്യുന്നു.

  3. ടോക്കണുകളുടെ ഒരു ശ്രേണിയായി മറുപടി സൃഷ്ടിച്ചശേഷം അതിനെ വീണ്ടും ടെക്സ്റ്റാക്കി മാറ്റുന്നു.

ടോക്കൺ ഉപയോഗം വിവിധ വിഭാഗങ്ങളിലായി രേഖപ്പെടുത്തുന്നു:

  • ഇൻപുട്ട് ടോക്കണുകൾ – നിങ്ങളുടെ അഭ്യർഥനയിലെ ടോക്കണുകൾ.

  • ഔട്ട്‌പുട്ട് ടോക്കണുകൾ – മറുപടിയിൽ സൃഷ്ടിക്കുന്ന ടോക്കണുകൾ.

  • കാഷ് ചെയ്ത ടോക്കണുകൾ – സംഭാഷണചരിത്രത്തിൽ വീണ്ടും ഉപയോഗിക്കുന്ന ടോക്കണുകൾ. ഇവയ്ക്ക് പലപ്പോഴും കുറഞ്ഞ നിരക്കാണ് ഈടാക്കുന്നത്.

  • റീസണിംഗ് ടോക്കണുകൾ – ചില നൂതന മോഡലുകളിൽ അന്തിമ ഔട്ട്‌പുട്ട് സൃഷ്ടിക്കുന്നതിന് മുമ്പ് അധിക “ചിന്താഘട്ടങ്ങൾ” ആന്തരികമായി ഉൾപ്പെടുത്തുന്നു.

ഈ കണക്കുകൾ നിങ്ങളുടെ API മറുപടിയുടെ മെറ്റാഡാറ്റയിൽ പ്രത്യക്ഷപ്പെടുകയും ബില്ലിങ്ങിനും ഉപയോഗം നിരീക്ഷിക്കാനും ഉപയോഗിക്കുകയും ചെയ്യുന്നു.

ടോക്കനൈസേഷൻ കൂടുതൽ വിശദമായി മനസ്സിലാക്കാൻ ഞങ്ങളുടെ സംവേദനാത്മക ടോക്കനൈസർ ഉപകരണം ഉപയോഗിക്കാം. ഇത് ടോക്കണുകളുടെ എണ്ണം കണക്കാക്കാനും ടെക്സ്റ്റ് എങ്ങനെ ടോക്കണുകളായി വിഭജിക്കുന്നുവെന്ന് കാണാനും സഹായിക്കുന്നു.

പകരമായി, പ്രോഗ്രാമിലൂടെ ടെക്സ്റ്റ് ടോക്കനൈസ് ചെയ്യണമെങ്കിൽ, OpenAI മോഡലുകൾക്കായി പ്രത്യേകം ഉപയോഗിക്കുന്ന വേഗമേറിയ BPE ടോക്കനൈസറായ Tiktoken ഉപയോഗിക്കുക.

ടോക്കൺ പരിധികൾ

ഓരോ മോഡലിനും ഇൻപുട്ടും ഔട്ട്‌പുട്ടും ചേർന്ന പരമാവധി ടോക്കൺ പരിധിയുണ്ട്. നിലവിലെ ഉയർന്ന ശേഷിയുള്ള മോഡലുകൾ സന്ദർഭത്തിൽ ലക്ഷക്കണക്കിന് ടോക്കണുകൾ വരെ പിന്തുണയ്ക്കുന്നു. എന്നാൽ മോഡൽ പതിപ്പും നിങ്ങളുടെ ഉപയോഗനിലയും അനുസരിച്ച് പ്രായോഗിക പരിധികൾ വ്യത്യാസപ്പെടാം.

പരിധി കവിഞ്ഞാൽ നിങ്ങൾക്ക് ഇവ ചെയ്യാം:

  • പ്രോംപ്റ്റുകൾ ചുരുക്കുകയോ മറ്റൊരു രീതിയിൽ എഴുതുകയോ ചെയ്യുക.

  • വലിയ ടെക്സ്റ്റിനെ ചെറിയ ഭാഗങ്ങളായി വിഭജിക്കുക.

  • ഇൻപുട്ടുകൾ അയയ്ക്കുന്നതിന് മുമ്പ് അവ സംഗ്രഹിക്കുകയോ മുൻകൂട്ടി പ്രോസസ്സ് ചെയ്യുകയോ ചെയ്യുക.

ടോക്കൺ നിരക്കുകൾ

മോഡലിനെയും ടോക്കണുകൾ ഇൻപുട്ടാണോ ഔട്ട്‌പുട്ടാണോ കാഷ് ചെയ്തതാണോ എന്നതിനെയും ആശ്രയിച്ച്, ഓരോ ടോക്കണിനും API ഉപയോഗനിരക്ക് നിശ്ചയിക്കുന്നു. നിലവിലെ നിരക്കുകൾക്ക് OpenAI-യുടെ നിരക്കുകളുടെ പേജ് കാണുക. ചില റീസണിംഗ് മോഡലുകൾ ആന്തരികമായി കൂടുതൽ ടോക്കണുകൾ ഉപയോഗിച്ചേക്കാം. എന്നാൽ പൂർത്തിയാക്കുന്ന ഓരോ ജോലിക്കും വേണ്ട ടോക്കണുകളുടെ എണ്ണം കുറച്ച് കാര്യക്ഷമത മെച്ചപ്പെടുത്തുകയാണ് അവയുടെ ലക്ഷ്യം.

AI മോഡലുകൾക്കും ദാതാക്കൾക്കുമിടയിൽ ടോക്കണുകൾക്ക് ഏകീകൃത മാനദണ്ഡമില്ല. ഒരേ ടെക്സ്റ്റ് പ്രോസസ്സ് ചെയ്യാനോ സൃഷ്ടിക്കാനോ വ്യത്യസ്ത മോഡലുകൾ വ്യത്യസ്ത എണ്ണം ടോക്കണുകൾ ഉപയോഗിച്ചേക്കാം. അതിനാൽ പത്ത് ലക്ഷം ടോക്കണുകൾക്ക് പരസ്യപ്പെടുത്തുന്ന കുറഞ്ഞ നിരക്ക്, മൊത്തം ചെലവും കുറവായിരിക്കുമെന്ന് നിർബന്ധമില്ല.

ദൃശ്യമാകുന്ന മറുപടിയുടെ നീളം മാത്രം പൂർണചിത്രം നൽകുന്നില്ല. ചില മോഡലുകൾ മറുപടി നൽകുന്നതിന് മുമ്പ് ആന്തരികമായി റീസണിംഗ് ടോക്കണുകൾ ഉപയോഗിക്കുന്നു. അതിനാൽ ദൃശ്യമാകുന്ന മറുപടി നീളമുള്ളതാണെന്നത് മോഡൽ മൊത്തത്തിൽ കൂടുതൽ ടോക്കണുകൾ ഉപയോഗിച്ചുവെന്ന് നിർബന്ധമായും അർത്ഥമാക്കുന്നില്ല.

മോഡലുകൾ താരതമ്യം ചെയ്യുമ്പോൾ, ആവശ്യമായ മൊത്തം ടോക്കണുകളുടെ എണ്ണവും വിജയകരമായ ഓരോ ഫലത്തിനുമുള്ള ചെലവും പരിഗണിക്കുക. മാനദണ്ഡപരിശോധനകൾ ഉപകാരപ്രദമായ ഒരു തുടക്കമാകാം. എന്നാൽ നിങ്ങളുടെ സ്വന്തം ഉപയോഗസാഹചര്യങ്ങളിൽ മോഡലുകൾ പരീക്ഷിക്കുന്നതാണ് അവയുടെ യഥാർഥ ചെലവും പ്രകടനവും മനസ്സിലാക്കാനുള്ള മികച്ച മാർഗം.

ടോക്കണുകളെക്കുറിച്ച് അറിയുക

കോർപ്പസ് ഡാറ്റയിലെ സന്ദർഭത്തിന് അനുസരിച്ചാണ് API വാക്കുകളെ കൈകാര്യം ചെയ്യുന്നത്. മോഡലുകൾ പ്രോംപ്റ്റ് സ്വീകരിച്ച് ഇൻപുട്ടിനെ ടോക്കണുകളുടെ പട്ടികയാക്കി മാറ്റുകയും പ്രോംപ്റ്റ് പ്രോസസ്സ് ചെയ്യുകയും പ്രവചിച്ച ടോക്കണുകളെ മറുപടിയിൽ കാണുന്ന വാക്കുകളാക്കി തിരികെ മാറ്റുകയും ചെയ്യുന്നു.

നമുക്ക് ഒരുപോലെ തോന്നുന്ന രണ്ട് വാക്കുകൾ, ടെക്സ്റ്റിനുള്ളിലെ അവയുടെ ഘടന അനുസരിച്ച് വ്യത്യസ്ത ടോക്കണുകളായി സൃഷ്ടിക്കപ്പെട്ടേക്കാം. ടെക്സ്റ്റിനുള്ളിലെ സന്ദർഭത്തെ അടിസ്ഥാനമാക്കി API ‘red’ എന്ന വാക്കിന് ടോക്കൺ മൂല്യങ്ങൾ സൃഷ്ടിക്കുന്നത് എങ്ങനെയെന്ന് നോക്കുക:

Sentence split into color-coded tokens with Text selected over Token IDs
Token ID output as a list of integers with the Token IDs tab selected

മുകളിലെ ആദ്യ ഉദാഹരണത്തിൽ ‘ red’ എന്നതിനുള്ള “2266” എന്ന ടോക്കണിൽ അവസാനത്തെ സ്പേസ് ഉൾപ്പെടുന്നു. ഇവ വിശദീകരണത്തിനായി നൽകിയ ഉദാഹരണ ടോക്കൺ ഐഡികളാണെന്നത് ശ്രദ്ധിക്കുക.

Sentence split into color-coded token blocks: My favorite color is Red.
Tokenizer output with Token IDs selected and a list of numeric token IDs

‘ Red’ എന്നതിനുള്ള “2296” എന്ന ടോക്കൺ, ചെറിയക്ഷരത്തിലുള്ള ‘ red’ എന്നതിനുള്ള “2266” എന്ന ടോക്കണിൽനിന്ന് വ്യത്യസ്തമാണ്. ആദ്യത്തേതിന് തുടക്കത്തിൽ സ്പേസും വലിയക്ഷരവുമുണ്ട്.

Tokenizer example splitting “Red is my favorite color.” into color-coded tokens
Tokenizer output with Token IDs selected and a list of token ID numbers

‘Red’ ഒരു വാക്യത്തിന്റെ തുടക്കത്തിൽ ഉപയോഗിക്കുമ്പോൾ, സൃഷ്ടിക്കുന്ന ടോക്കണിൽ തുടക്കത്തിലെ സ്പേസ് ഉൾപ്പെടുന്നില്ല. “7738” എന്ന ടോക്കൺ, ഈ വാക്കിന്റെ മുമ്പത്തെ രണ്ട് ഉദാഹരണങ്ങളിൽനിന്നും വ്യത്യസ്തമാണ്.

നിരീക്ഷണങ്ങൾ:

ഒരു ടോക്കൺ കൂടുതൽ സാധ്യതയുള്ളതോ പതിവായി ഉപയോഗിക്കുന്നതോ ആണെങ്കിൽ, അതിന് നൽകുന്ന ടോക്കൺ സംഖ്യ കുറവായിരിക്കും:

  • പൂർണവിരാമത്തിന് സൃഷ്ടിച്ച ടോക്കൺ മൂന്ന് വാക്യങ്ങളിലും ഒന്നുതന്നെയാണ്, അതായത് “13”. കോർപ്പസ് ഡാറ്റയിലുടനീളം പൂർണവിരാമം സന്ദർഭപരമായി ഏറെക്കുറെ ഒരേ രീതിയിൽ ഉപയോഗിക്കുന്നതിനാലാണിത്.

  • വാക്യത്തിൽ ‘red’ വരുന്ന സ്ഥാനത്തിന് അനുസരിച്ച് അതിനായി സൃഷ്ടിക്കുന്ന ടോക്കൺ വ്യത്യാസപ്പെടുന്നു:

    • വാക്യത്തിന്റെ മധ്യത്തിൽ ചെറിയക്ഷരത്തിൽ: ‘ red’ - (ടോക്കൺ: “2266”)

    • വാക്യത്തിന്റെ മധ്യത്തിൽ വലിയക്ഷരത്തിൽ: ‘ Red’ - (ടോക്കൺ: “2297”)

    • വാക്യത്തിന്റെ തുടക്കത്തിൽ വലിയക്ഷരത്തിൽ: ‘Red’ - (ടോക്കൺ: “7738”)

ഈ ലേഖനം ഉപകാരപ്രദമായിരുന്നോ?