OpenAI
ဤစာမျက်နှာကို စက်ဖြင့် ဘာသာပြန်ထားပါသည်။ မူရင်း အင်္ဂလိပ်ဆောင်းပါးကို ကြည့်ရန်

စာကြောင်းတစ်ခုကို embedding မလုပ်ခင် တိုကင် ဘယ်လောက်ရှိမလဲဆိုတာ ဘယ်လို သိနိုင်မလဲ?

embedding အတွက် တိုကင်အရေအတွက်ကို တွက်ချက်/ခန့်မှန်းခြင်း

အပ်ဒိတ်လုပ်ထားသည်- yesterday

string တစ်ခုကို embedding အတွက် မပို့မီ OpenAI ၏ tiktoken တိုကင်နိုက်ဇာ library ကို အသုံးပြုခြင်းဖြင့် ၎င်းအသုံးပြုမည့် တိုကင်အရေအတွက်ကို ခန့်မှန်းနိုင်သည်။

embedding မော်ဒယ်များ (ဥပမာ text-embedding-3-small) တွင် သင်လိုက်နာရမည့် အများဆုံး တိုကင်ကန့်သတ်ချက်များ ရှိသောကြောင့် ဤအချက်သည် အထူးအသုံးဝင်သည်။

---

Tiktoken ဖြင့် တိုကင်များ ရေတွက်နည်း

string တစ်ခုက ထုတ်ပေးမည့် တိုကင်အရေအတွက်ကို တွက်ချက်ရန် tiktoken Python package ကို အသုံးပြုနိုင်သည်။

ဤသည်မှာ နမူနာကုဒ်အပိုင်းအစတစ်ခုဖြစ်သည်:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""စာသား string တစ်ခုအတွင်းရှိ တိုကင်အရေအတွက်ကို ပြန်ပေးသည်။"""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

အရေးကြီး:

  • တတိယမျိုးဆက် embedding မော်ဒယ်များ (ဥပမာ text-embedding-3-small သို့မဟုတ် text-embedding-3-large) အတွက် "cl100k_base" encoding ကို အသုံးပြုသင့်သည်။

  • မော်ဒယ်အမျိုးမျိုးအတွက် encoding အမျိုးမျိုး လိုအပ်နိုင်သည် — မသေချာပါက မော်ဒယ်စာရွက်စာတမ်းကို အမြဲ ကိုးကားပါ။

---

တိုကင်ရေတွက်ခြင်းက ဘာကြောင့် အရေးကြီးသလဲ

  • သင်၏ string သည် မော်ဒယ်၏ အများဆုံး input အရွယ်အစားကို ကျော်လွန်ပါက သင်၏ API တောင်းဆိုမှု မအောင်မြင်ပါ။

  • တိုကင်များကို ကြိုတင်တိကျစွာ ရေတွက်ခြင်းက embedding workflow များကို ပိုမိုချောမွေ့စေပြီး လုပ်ဆောင်နေစဉ် အမှားများကို ကာကွယ်ပေးသည်။

---

ဤဆောင်းပါးသည် အထောက်အကူ ဖြစ်ပါသလား။