OpenAI
ይህ ገጽ በማሽን የተተረጎመ ነው። ዋናውን የእንግሊዝኛ ጽሑፍ ይመልከቱ

አንድ string ለembed ከመሞከሬ በፊት ስንት token እንደሚኖረው እንዴት ላውቅ?

ለአንድ embedding token ማስላት/መገመት

የተዘመነው፦ 7 days ago

አንድን ሕብረቁምፊ ለኢምቤዲንግ ከመላክዎ በፊት፣ ከOpenAI የሆነውን የtiktoken tokenizer ላይብረሪ በመተግበር ስንት token እንደሚጠቀም መገመት ይችላሉ።

ይህ በተለይ ጠቃሚ ነው፣ ምክንያቱም የኢምቤዲንግ ሞዴሎች (እንደ text-embedding-3-small) መብለጥ የሌለብዎት ከፍተኛ የtoken ገደቦች አሏቸው።

---

በTiktoken tokenዎችን እንዴት መቁጠር እንደሚቻል

አንድ ሕብረቁምፊ ስንት tokenዎችን እንደሚፈጥር ለማስላት፣ የPython tiktoken ፓኬጅን መጠቀም ይችላሉ።

የናሙና የኮድ ቅንጭብ እነሆ፦

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""በአንድ የጽሑፍ string ውስጥ ያሉትን የtoken ብዛት ይመልሳል።"""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# የአጠቃቀም ምሳሌ
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

አስፈላጊ:

  • ሦስተኛ ትውልድ ኢምቤዲንግ ሞዴሎች (ለምሳሌ፣ text-embedding-3-small ወይም text-embedding-3-large)፣ "cl100k_base" የተባለውን ኢንኮዲንግ መጠቀም አለብዎት።

  • የተለያዩ ሞዴሎች የተለያዩ ኢንኮዲንጎችን ሊፈልጉ ይችላሉ — እርግጠኛ ካልሆኑ ሁልጊዜ የሞዴሉን ሰነድ ይመልከቱ።

---

የtoken ቆጠራ ለምን አስፈላጊ ነው

  • የእርስዎ ሕብረቁምፊ የሞዴሉን ከፍተኛ የግቤት መጠን ካለፈ፣ የAPI ጥያቄዎ ይከሽፋል።

  • tokenዎችን አስቀድሞ በትክክል መቁጠር የኢምቤዲንግ የስራ ሂደቶችን የተቀላጠፉ ያደርጋል እና በሂደት ወቅት ስህተቶችን ይከላከላል።

---

ይህ ጽሑፍ ጠቃሚ ነበር?