စာသားတန်းတစ်ခုကို embedding ပြုလုပ်ရန် မပို့မီ OpenAI ၏ tiktoken တိုကင်ခွဲခြမ်းရေး library ကို အသုံးပြု၍ တိုကင်မည်မျှ သုံးမည်ကို ခန့်မှန်းနိုင်သည်။
embedding မော်ဒယ်များတွင် (ဥပမာ text-embedding-3-small) မကျော်လွန်ရမည့် အများဆုံး တိုကင်အရေအတွက် ကန့်သတ်ချက်ရှိသောကြောင့် ဤနည်းလမ်းသည် အထူးအသုံးဝင်သည်။
---
Tiktoken ဖြင့် တိုကင်များ ရေတွက်နည်း
string တစ်ခုက ထုတ်ပေးမည့် တိုကင်အရေအတွက်ကို တွက်ချက်ရန် tiktoken Python package ကို အသုံးပြုနိုင်သည်။
ဤသည်မှာ နမူနာကုဒ်အပိုင်းအစတစ်ခုဖြစ်သည်:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""စာသား string တစ်ခုအတွင်းရှိ တိုကင်အရေအတွက်ကို ပြန်ပေးသည်။"""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)အရေးကြီးသည်:
တတိယမျိုးဆက် embedding မော်ဒယ်များ (ဥပမာ၊ text-embedding-3-small သို့မဟုတ် text-embedding-3-large) အတွက် "cl100k_base" encoding ကို အသုံးပြုသင့်သည်။
မော်ဒယ်အလိုက် လိုအပ်သည့် encoding ကွဲပြားနိုင်သည်။ မသေချာပါက မော်ဒယ်၏ စာရွက်စာတမ်းကို အမြဲကိုးကားပါ။
---
တိုကင်ရေတွက်ခြင်းက ဘာကြောင့် အရေးကြီးသလဲ
သင်၏ string သည် မော်ဒယ်၏ အများဆုံး input အရွယ်အစားကို ကျော်လွန်ပါက သင်၏ API တောင်းဆိုမှု မအောင်မြင်ပါ။
တိုကင်များကို ကြိုတင်တိကျစွာ ရေတွက်ခြင်းက embedding workflow များကို ပိုမိုချောမွေ့စေပြီး လုပ်ဆောင်နေစဉ် အမှားများကို ကာကွယ်ပေးသည်။
---
