OpenAI
ይህ ገጽ በማሽን የተተረጎመ ነው። ዋናውን የእንግሊዝኛ ጽሑፍ ይመልከቱ

አንድ string ለembed ከመሞከሬ በፊት ስንት token እንደሚኖረው እንዴት ላውቅ?

ለአንድ embedding token ማስላት/መገመት

የተዘመነው፦ 16 days ago

ሕብረቁምፊን ለመክተት ከመላክዎ በፊት፣ የOpenAIን tiktoken token መከፋፈያ ላይብረሪ በመጠቀም ምን ያህል token እንደሚጠቀም መገመት ይችላሉ።

ይህ በተለይ የመክተት ሞዴሎች (እንደ text-embedding-3-small) ሊያልፉት የማይገባ ከፍተኛ የtoken ብዛት ገደብ ስላላቸው ጠቃሚ ነው።

---

በTiktoken tokenዎችን እንዴት መቁጠር እንደሚቻል

አንድ ሕብረቁምፊ ስንት tokenዎችን እንደሚፈጥር ለማስላት፣ የPython tiktoken ፓኬጅን መጠቀም ይችላሉ።

የናሙና የኮድ ቅንጭብ እነሆ፦

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""በአንድ የጽሑፍ string ውስጥ ያሉትን የtoken ብዛት ይመልሳል።"""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# የአጠቃቀም ምሳሌ
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

አስፈላጊ

  • ሦስተኛ ትውልድ የመክተት ሞዴሎች (ለምሳሌ፣ text-embedding-3-small ወይም text-embedding-3-large)፣ የ"cl100k_base" ኢንኮዲንግን መጠቀም አለብዎት።

  • የተለያዩ ሞዴሎች የተለያዩ ኢንኮዲንጎችን ሊፈልጉ ይችላሉ፤ እርግጠኛ ካልሆኑ ሁልጊዜ የሞዴሉን ሰነድ ይመልከቱ።

---

የtoken ቆጠራ ለምን አስፈላጊ ነው

  • የእርስዎ ሕብረቁምፊ የሞዴሉን ከፍተኛ የግቤት መጠን ካለፈ፣ የAPI ጥያቄዎ ይከሽፋል።

  • tokenዎችን አስቀድሞ በትክክል መቁጠር የኢምቤዲንግ የስራ ሂደቶችን የተቀላጠፉ ያደርጋል እና በሂደት ወቅት ስህተቶችን ይከላከላል።

---

ይህ ጽሑፍ ጠቃሚ ነበር?