OpenAI
ഈ പേജ് യന്ത്രസഹായത്താൽ വിവർത്തനം ചെയ്തത് ആണ്. യഥാർത്ഥ ഇംഗ്ലീഷ് ലേഖനം കാണുക.

ഒരു സ്ട്രിംഗ് embed ചെയ്യാൻ ശ്രമിക്കുന്നതിന് മുമ്പ് അതിന് എത്ര ടോക്കൺ ഉണ്ടാകുമെന്ന് എങ്ങനെ അറിയാം?

ഒരു embedding-നുള്ള ടോക്കണുകൾ കണക്കാക്കൽ/ഏകദേശ കണക്ക്

അപ്‌ഡേറ്റ് ചെയ്തത്: 8 days ago.

ഒരു സ്ട്രിംഗ് എംബെഡിംഗിനായി അയയ്ക്കുന്നതിന് മുമ്പ്, OpenAI-യുടെ tiktoken ടോക്കനൈസർ ലൈബ്രറി പ്രയോഗിച്ച് അത് എത്ര ടോക്കണുകൾ ഉപയോഗിക്കുമെന്ന് കണക്കാക്കാം.

ഇത് പ്രത്യേകിച്ച് ഉപകാരപ്പെടുന്നു, കാരണം എംബെഡിംഗ് മോഡലുകൾക്ക് (text-embedding-3-small പോലുള്ളവ) നിങ്ങൾ പാലിക്കേണ്ട പരമാവധി ടോക്കൺ പരിധികളുണ്ട്.

---

Tiktoken ഉപയോഗിച്ച് ടോക്കണുകൾ എങ്ങനെ എണ്ണാം

ഒരു സ്ട്രിംഗ് സൃഷ്ടിക്കുന്ന ടോക്കണുകളുടെ എണ്ണം കണക്കാക്കാൻ tiktoken Python പാക്കേജ് ഉപയോഗിക്കാം.

ഒരു സാമ്പിൾ കോഡ് സ്നിപ്പറ്റ് ഇതാ:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""ഒരു ടെക്സ്റ്റ് സ്ട്രിംഗിലുള്ള ടോക്കണുകളുടെ എണ്ണം മടക്കിനൽകുന്നു."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# ഉദാഹരണ ഉപയോഗം
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

പ്രധാനപ്പെട്ടത്:

  • മൂന്നാം തലമുറ എംബെഡിംഗ് മോഡലുകൾക്ക് (ഉദാ., text-embedding-3-small അല്ലെങ്കിൽ text-embedding-3-large), നിങ്ങൾ "cl100k_base" എൻകോഡിംഗ് ഉപയോഗിക്കണം.

  • വ്യത്യസ്ത മോഡലുകൾക്ക് വ്യത്യസ്ത എൻകോഡിംഗുകൾ ആവശ്യമായേക്കാം — ഉറപ്പില്ലെങ്കിൽ എപ്പോഴും മോഡൽ ഡോക്യുമെന്റേഷൻ നോക്കുക.

---

ടോക്കൺ എണ്ണൽ പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്

  • നിങ്ങളുടെ സ്ട്രിംഗ് മോഡലിന്റെ പരമാവധി ഇൻപുട്ട് വലുപ്പം കവിഞ്ഞാൽ, നിങ്ങളുടെ API അഭ്യർത്ഥന പരാജയപ്പെടും.

  • മുൻകൂട്ടി ടോക്കണുകൾ കൃത്യമായി എണ്ണുന്നത് എംബെഡിംഗ് വർക്ക്‌ഫ്ലോകൾ കൂടുതൽ സുഗമമാക്കുകയും പ്രോസസ്സിംഗിനിടയിലെ പിശകുകൾ തടയുകയും ചെയ്യുന്നു.

---

ഈ ലേഖനം ഉപകാരപ്രദമായിരുന്നോ?