OpenAI
ဤစာမျက်နှာကို စက်ဖြင့် ဘာသာပြန်ထားပါသည်။ မူရင်း အင်္ဂလိပ်ဆောင်းပါးကို ကြည့်ရန်

စာကြောင်းတစ်ခုကို embedding မလုပ်ခင် တိုကင် ဘယ်လောက်ရှိမလဲဆိုတာ ဘယ်လို သိနိုင်မလဲ?

embedding အတွက် တိုကင်အရေအတွက်ကို တွက်ချက်/ခန့်မှန်းခြင်း

အပ်ဒိတ်လုပ်ထားသည်- 17 days ago

စာသားတန်းတစ်ခုကို embedding ပြုလုပ်ရန် မပို့မီ OpenAI ၏ tiktoken တိုကင်ခွဲခြမ်းရေး library ကို အသုံးပြု၍ တိုကင်မည်မျှ သုံးမည်ကို ခန့်မှန်းနိုင်သည်။

embedding မော်ဒယ်များတွင် (ဥပမာ text-embedding-3-small) မကျော်လွန်ရမည့် အများဆုံး တိုကင်အရေအတွက် ကန့်သတ်ချက်ရှိသောကြောင့် ဤနည်းလမ်းသည် အထူးအသုံးဝင်သည်။

---

Tiktoken ဖြင့် တိုကင်များ ရေတွက်နည်း

string တစ်ခုက ထုတ်ပေးမည့် တိုကင်အရေအတွက်ကို တွက်ချက်ရန် tiktoken Python package ကို အသုံးပြုနိုင်သည်။

ဤသည်မှာ နမူနာကုဒ်အပိုင်းအစတစ်ခုဖြစ်သည်:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""စာသား string တစ်ခုအတွင်းရှိ တိုကင်အရေအတွက်ကို ပြန်ပေးသည်။"""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

အရေးကြီးသည်:

  • တတိယမျိုးဆက် embedding မော်ဒယ်များ (ဥပမာ၊ text-embedding-3-small သို့မဟုတ် text-embedding-3-large) အတွက် "cl100k_base" encoding ကို အသုံးပြုသင့်သည်။

  • မော်ဒယ်အလိုက် လိုအပ်သည့် encoding ကွဲပြားနိုင်သည်။ မသေချာပါက မော်ဒယ်၏ စာရွက်စာတမ်းကို အမြဲကိုးကားပါ။

---

တိုကင်ရေတွက်ခြင်းက ဘာကြောင့် အရေးကြီးသလဲ

  • သင်၏ string သည် မော်ဒယ်၏ အများဆုံး input အရွယ်အစားကို ကျော်လွန်ပါက သင်၏ API တောင်းဆိုမှု မအောင်မြင်ပါ။

  • တိုကင်များကို ကြိုတင်တိကျစွာ ရေတွက်ခြင်းက embedding workflow များကို ပိုမိုချောမွေ့စေပြီး လုပ်ဆောင်နေစဉ် အမှားများကို ကာကွယ်ပေးသည်။

---

ဤဆောင်းပါးသည် အထောက်အကူ ဖြစ်ပါသလား။