አንድን ሕብረቁምፊ ለኢምቤዲንግ ከመላክዎ በፊት፣ ከOpenAI የሆነውን የtiktoken tokenizer ላይብረሪ በመተግበር ስንት token እንደሚጠቀም መገመት ይችላሉ።
ይህ በተለይ ጠቃሚ ነው፣ ምክንያቱም የኢምቤዲንግ ሞዴሎች (እንደ text-embedding-3-small) መብለጥ የሌለብዎት ከፍተኛ የtoken ገደቦች አሏቸው።
---
በTiktoken tokenዎችን እንዴት መቁጠር እንደሚቻል
አንድ ሕብረቁምፊ ስንት tokenዎችን እንደሚፈጥር ለማስላት፣ የPython tiktoken ፓኬጅን መጠቀም ይችላሉ።
የናሙና የኮድ ቅንጭብ እነሆ፦
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""በአንድ የጽሑፍ string ውስጥ ያሉትን የtoken ብዛት ይመልሳል።"""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# የአጠቃቀም ምሳሌ
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)አስፈላጊ:
ለሦስተኛ ትውልድ ኢምቤዲንግ ሞዴሎች (ለምሳሌ፣
text-embedding-3-smallወይምtext-embedding-3-large)፣"cl100k_base"የተባለውን ኢንኮዲንግ መጠቀም አለብዎት።የተለያዩ ሞዴሎች የተለያዩ ኢንኮዲንጎችን ሊፈልጉ ይችላሉ — እርግጠኛ ካልሆኑ ሁልጊዜ የሞዴሉን ሰነድ ይመልከቱ።
---
የtoken ቆጠራ ለምን አስፈላጊ ነው
የእርስዎ ሕብረቁምፊ የሞዴሉን ከፍተኛ የግቤት መጠን ካለፈ፣ የAPI ጥያቄዎ ይከሽፋል።
tokenዎችን አስቀድሞ በትክክል መቁጠር የኢምቤዲንግ የስራ ሂደቶችን የተቀላጠፉ ያደርጋል እና በሂደት ወቅት ስህተቶችን ይከላከላል።
---
