ഉൾച്ചേർക്കലിനായി ഒരു പാഠശൃംഖല അയയ്ക്കുന്നതിനുമുമ്പ്, OpenAIയുടെ tiktoken ടോക്കണൈസർ ഗ്രന്ഥശാല ഉപയോഗിച്ച് അതിന് എത്ര ടോക്കണുകൾ വേണ്ടിവരുമെന്ന് കണക്കാക്കാം.
ഉൾച്ചേർക്കൽ മോഡലുകൾക്ക് (text-embedding-3-small പോലുള്ളവയ്ക്ക്) ലംഘിക്കാനാകാത്ത പരമാവധി ടോക്കൺ പരിധികളുള്ളതിനാൽ ഇത് ഏറെ പ്രയോജനകരമാണ്.
---
Tiktoken ഉപയോഗിച്ച് ടോക്കണുകൾ എങ്ങനെ എണ്ണാം
ഒരു സ്ട്രിംഗ് സൃഷ്ടിക്കുന്ന ടോക്കണുകളുടെ എണ്ണം കണക്കാക്കാൻ tiktoken Python പാക്കേജ് ഉപയോഗിക്കാം.
ഒരു സാമ്പിൾ കോഡ് സ്നിപ്പറ്റ് ഇതാ:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""ഒരു ടെക്സ്റ്റ് സ്ട്രിംഗിലുള്ള ടോക്കണുകളുടെ എണ്ണം മടക്കിനൽകുന്നു."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# ഉദാഹരണ ഉപയോഗം
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)പ്രധാനം:
മൂന്നാം തലമുറയിലെ ഉൾച്ചേർക്കൽ മോഡലുകൾക്ക് (ഉദാ., text-embedding-3-small അല്ലെങ്കിൽ text-embedding-3-large) "cl100k_base" എൻകോഡിങ് ഉപയോഗിക്കണം.
വ്യത്യസ്ത മോഡലുകൾക്ക് വ്യത്യസ്ത എൻകോഡിങ്ങുകൾ ആവശ്യമായി വന്നേക്കാം — സംശയമുണ്ടെങ്കിൽ എപ്പോഴും മോഡലിന്റെ പ്രമാണീകരണം പരിശോധിക്കുക.
---
ടോക്കൺ എണ്ണൽ പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്
നിങ്ങളുടെ സ്ട്രിംഗ് മോഡലിന്റെ പരമാവധി ഇൻപുട്ട് വലുപ്പം കവിഞ്ഞാൽ, നിങ്ങളുടെ API അഭ്യർത്ഥന പരാജയപ്പെടും.
മുൻകൂട്ടി ടോക്കണുകൾ കൃത്യമായി എണ്ണുന്നത് എംബെഡിംഗ് വർക്ക്ഫ്ലോകൾ കൂടുതൽ സുഗമമാക്കുകയും പ്രോസസ്സിംഗിനിടയിലെ പിശകുകൾ തടയുകയും ചെയ്യുന്നു.
---
