string တစ်ခုကို embedding အတွက် မပို့မီ OpenAI ၏ tiktoken တိုကင်နိုက်ဇာ library ကို အသုံးပြုခြင်းဖြင့် ၎င်းအသုံးပြုမည့် တိုကင်အရေအတွက်ကို ခန့်မှန်းနိုင်သည်။
embedding မော်ဒယ်များ (ဥပမာ text-embedding-3-small) တွင် သင်လိုက်နာရမည့် အများဆုံး တိုကင်ကန့်သတ်ချက်များ ရှိသောကြောင့် ဤအချက်သည် အထူးအသုံးဝင်သည်။
---
Tiktoken ဖြင့် တိုကင်များ ရေတွက်နည်း
string တစ်ခုက ထုတ်ပေးမည့် တိုကင်အရေအတွက်ကို တွက်ချက်ရန် tiktoken Python package ကို အသုံးပြုနိုင်သည်။
ဤသည်မှာ နမူနာကုဒ်အပိုင်းအစတစ်ခုဖြစ်သည်:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""စာသား string တစ်ခုအတွင်းရှိ တိုကင်အရေအတွက်ကို ပြန်ပေးသည်။"""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)အရေးကြီး:
တတိယမျိုးဆက် embedding မော်ဒယ်များ (ဥပမာ
text-embedding-3-smallသို့မဟုတ်text-embedding-3-large) အတွက်"cl100k_base"encoding ကို အသုံးပြုသင့်သည်။မော်ဒယ်အမျိုးမျိုးအတွက် encoding အမျိုးမျိုး လိုအပ်နိုင်သည် — မသေချာပါက မော်ဒယ်စာရွက်စာတမ်းကို အမြဲ ကိုးကားပါ။
---
တိုကင်ရေတွက်ခြင်းက ဘာကြောင့် အရေးကြီးသလဲ
သင်၏ string သည် မော်ဒယ်၏ အများဆုံး input အရွယ်အစားကို ကျော်လွန်ပါက သင်၏ API တောင်းဆိုမှု မအောင်မြင်ပါ။
တိုကင်များကို ကြိုတင်တိကျစွာ ရေတွက်ခြင်းက embedding workflow များကို ပိုမိုချောမွေ့စေပြီး လုပ်ဆောင်နေစဉ် အမှားများကို ကာကွယ်ပေးသည်။
---
