ഒരു സ്ട്രിംഗ് എംബെഡിംഗിനായി അയയ്ക്കുന്നതിന് മുമ്പ്, OpenAI-യുടെ tiktoken ടോക്കനൈസർ ലൈബ്രറി പ്രയോഗിച്ച് അത് എത്ര ടോക്കണുകൾ ഉപയോഗിക്കുമെന്ന് കണക്കാക്കാം.
ഇത് പ്രത്യേകിച്ച് ഉപകാരപ്പെടുന്നു, കാരണം എംബെഡിംഗ് മോഡലുകൾക്ക് (text-embedding-3-small പോലുള്ളവ) നിങ്ങൾ പാലിക്കേണ്ട പരമാവധി ടോക്കൺ പരിധികളുണ്ട്.
---
Tiktoken ഉപയോഗിച്ച് ടോക്കണുകൾ എങ്ങനെ എണ്ണാം
ഒരു സ്ട്രിംഗ് സൃഷ്ടിക്കുന്ന ടോക്കണുകളുടെ എണ്ണം കണക്കാക്കാൻ tiktoken Python പാക്കേജ് ഉപയോഗിക്കാം.
ഒരു സാമ്പിൾ കോഡ് സ്നിപ്പറ്റ് ഇതാ:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""ഒരു ടെക്സ്റ്റ് സ്ട്രിംഗിലുള്ള ടോക്കണുകളുടെ എണ്ണം മടക്കിനൽകുന്നു."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# ഉദാഹരണ ഉപയോഗം
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)പ്രധാനപ്പെട്ടത്:
മൂന്നാം തലമുറ എംബെഡിംഗ് മോഡലുകൾക്ക് (ഉദാ.,
text-embedding-3-smallഅല്ലെങ്കിൽtext-embedding-3-large), നിങ്ങൾ"cl100k_base"എൻകോഡിംഗ് ഉപയോഗിക്കണം.വ്യത്യസ്ത മോഡലുകൾക്ക് വ്യത്യസ്ത എൻകോഡിംഗുകൾ ആവശ്യമായേക്കാം — ഉറപ്പില്ലെങ്കിൽ എപ്പോഴും മോഡൽ ഡോക്യുമെന്റേഷൻ നോക്കുക.
---
ടോക്കൺ എണ്ണൽ പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്
നിങ്ങളുടെ സ്ട്രിംഗ് മോഡലിന്റെ പരമാവധി ഇൻപുട്ട് വലുപ്പം കവിഞ്ഞാൽ, നിങ്ങളുടെ API അഭ്യർത്ഥന പരാജയപ്പെടും.
മുൻകൂട്ടി ടോക്കണുകൾ കൃത്യമായി എണ്ണുന്നത് എംബെഡിംഗ് വർക്ക്ഫ്ലോകൾ കൂടുതൽ സുഗമമാക്കുകയും പ്രോസസ്സിംഗിനിടയിലെ പിശകുകൾ തടയുകയും ചെയ്യുന്നു.
---
