တိုကင်များဆိုတာ ဘာလဲ။
တိုကင်များသည် OpenAI မော်ဒယ်များက လုပ်ဆောင်သည့် စာသား၏ အခြေခံတည်ဆောက်မှု အစိတ်အပိုင်းများဖြစ်သည်။ ဘာသာစကားနှင့် အကြောင်းအရာပေါ် မူတည်၍ ၎င်းတို့သည် စာလုံးတစ်လုံးတည်းလောက် တိုနိုင်သလို စကားလုံးတစ်လုံးလုံးလောက် ရှည်နိုင်သည်။ နေရာလွတ်များ၊ ပုဒ်ဖြတ်ပုဒ်ရပ်များနှင့် စကားလုံးအစိတ်အပိုင်းများအားလုံးသည် တိုကင်အရေအတွက်တွင် ပါဝင်သည်။ ဤသည်မှာ တုံ့ပြန်ချက်တစ်ခု ထုတ်လုပ်မပေးမီ API က သင့်စာသားကို အတွင်းပိုင်းတွင် အပိုင်းခွဲပုံဖြစ်သည်။
အင်္ဂလိပ်ဘာသာအတွက် အသုံးဝင်သော ခန့်မှန်းစည်းမျဉ်းများ-
တိုကင် 1 ခု ≈ စာလုံး 4 လုံး
တိုကင် 1 ခု ≈ စကားလုံးတစ်လုံး၏ ¾
တိုကင် 100 ခု ≈ စကားလုံး 75 လုံး
ဝါကျ 1–2 ကြောင်း ≈ တိုကင် 30 ခု
စာပိုဒ် 1 ပိုဒ် ≈ တိုကင် 100 ခု
စကားလုံး ~1,500 လုံး ≈ တိုကင် 2,048 ခု
တိုကင်လုပ်ခြင်းသည် မော်ဒယ်နှင့် encoding အလိုက် ကွဲပြားသည်။ သင့်ရည်မှန်းထားသော မော်ဒယ်အတွက် တိကျသောအရေအတွက်ရရန် Tokenizer ကိရိယာ သို့မဟုတ် tiktoken.encoding_for_model(model) ကို အသုံးပြုပါ။
ဥပမာများ
အနီးစပ်ဆုံး တိုကင်အရေအတွက်များနှင့်အတူ လက်တွေ့အသုံးပြုသော စာသားနမူနာအချို့မှာ-
Wayne Gretzky ၏ ကိုးကားချက် “မင်းမပစ်လိုက်တဲ့ ပစ်ချက်တွေရဲ့ 100% ကို မင်းလွဲမယ်” = တိုကင် 11 ခု
OpenAI Charter = တိုကင် 476 ခု
အမေရိကန် လွတ်လပ်ရေးကြေညာစာတမ်း = တိုကင် 1,695 ခု
တိုကင်အရေအတွက်များကို တွက်ချက်ပုံ
သင် API သို့ စာသားပို့သည့်အခါ-
စာသားကို တိုကင်များအဖြစ် ခွဲသည်။
မော်ဒယ်သည် ဤတိုကင်များကို လုပ်ဆောင်သည်။
တုံ့ပြန်ချက်ကို တိုကင်အစဉ်တစ်ခုအဖြစ် ထုတ်လုပ်ပြီးနောက် စာသားအဖြစ် ပြန်လည်ပြောင်းလဲသည်။
တိုကင်အသုံးပြုမှုကို အမျိုးအစားအချို့ဖြင့် ခြေရာခံထားသည်-
ထည့်သွင်း တိုကင်များ – သင့်တောင်းဆိုမှုရှိ တိုကင်များ။
ထွက်လာသည့် တိုကင်များ – တုံ့ပြန်ချက်တွင် ထုတ်လုပ်ထားသော တိုကင်များ။
ကက်ရှ်ထားသော တိုကင်များ – စကားပြောမှတ်တမ်းတွင် ပြန်လည်အသုံးပြုသည့် တိုကင်များ (အများအားဖြင့် လျှော့ထားသော နှုန်းထားဖြင့် ကောက်ခံသည်)။
ကျိုးကြောင်းသင့်လျော်စွာ စဉ်းစားပေးသော တိုကင်များ – အဆင့်မြင့် မော်ဒယ်အချို့တွင် နောက်ဆုံးထွက်ရလဒ် မထုတ်မီ အတွင်းပိုင်း၌ အပို “စဉ်းစားမှုအဆင့်များ” ပါဝင်သည်။
ဤအရေအတွက်များသည် သင့် API တုံ့ပြန်ချက်၏ metadata တွင် ပေါ်လာပြီး ငွေကောက်ခံမှုနှင့် အသုံးပြုမှုခြေရာခံမှုအတွက် အသုံးပြုသည်။
တိုကင်လုပ်ခြင်းကို ပိုမိုလေ့လာရန် ကျွန်ုပ်တို့၏ အပြန်အလှန်လုပ်ဆောင်နိုင်သော Tokenizer ကိရိယာကို အသုံးပြုနိုင်ပြီး၊ ၎င်းက တိုကင်အရေအတွက်ကို တွက်ချက်ရန်နှင့် စာသားကို တိုကင်များအဖြစ် မည်သို့ခွဲထားသည်ကို ကြည့်ရှုရန် ခွင့်ပြုသည်။
တစ်နည်းအားဖြင့် စာသားကို ပရိုဂရမ်ဖြင့် တိုကင်လုပ်လိုပါက OpenAI မော်ဒယ်များအတွက် အထူးအသုံးပြုသော မြန်ဆန်သည့် BPE tokenizer အဖြစ် Tiktoken ကို အသုံးပြုပါ။
တိုကင်ကန့်သတ်ချက်များ
မော်ဒယ်တစ်ခုစီတွင် ပေါင်းစပ်တိုကင်ကန့်သတ်ချက် အများဆုံးတစ်ခု (ထည့်သွင်းမှု + ထွက်ရလဒ်) ရှိသည်။ လက်ရှိ စွမ်းရည်မြင့် မော်ဒယ်များသည် context တွင် တိုကင် သိန်းနှင့်ချီအထိ ပံ့ပိုးနိုင်သော်လည်း လက်တွေ့ကန့်သတ်ချက်များမှာ မော်ဒယ်ဗားရှင်းနှင့် သင့်အသုံးပြုမှုအဆင့်ပေါ် မူတည်၍ ကွဲပြားနိုင်သည်။
ကန့်သတ်ချက်ကို ကျော်လွန်ပါက သင်လုပ်နိုင်သည်မှာ-
တုံ့ပြန်ညွှန်ကြားချက်များကို တိုစေပါ သို့မဟုတ် ပြန်လည်ရေးသားပါ။
စာသားကြီးများကို အပိုင်းငယ်များအဖြစ် ခွဲပါ။
ထည့်သွင်းချက်များကို မပို့မီ အကျဉ်းချုပ်ပါ သို့မဟုတ် ကြိုတင်လုပ်ဆောင်ပါ။
တိုကင်စျေးနှုန်း
API အသုံးပြုမှုကို တိုကင်အလိုက် စျေးနှုန်းသတ်မှတ်ပြီး မော်ဒယ်အလိုက်နှင့် တိုကင်များသည် ထည့်သွင်းမှု၊ ထွက်ရလဒ် သို့မဟုတ် ကက်ရှ်ထားသော တိုကင်များ ဖြစ်/မဖြစ်အလိုက် ကွဲပြားသည်။ လက်ရှိနှုန်းထားများအတွက် OpenAI ၏ စျေးနှုန်းစာမျက်နှာကို ကြည့်ပါ။ အချို့သော ကျိုးကြောင်းသင့်လျော်စွာ စဉ်းစားပေးသော မော်ဒယ်များသည် အတွင်းပိုင်းတွင် တိုကင်များ ပိုမိုအသုံးပြုနိုင်သော်လည်း ပြီးမြောက်သော လုပ်ငန်းတစ်ခုစီအတွက် လိုအပ်သည့် တိုကင်အရေအတွက်ကို လျှော့ချခြင်းဖြင့် ထိရောက်မှုမြှင့်တင်ရန် ရည်ရွယ်သည်။
တိုကင်များကို စူးစမ်းလေ့လာခြင်း
API သည် corpus data အတွင်းရှိ ၎င်းတို့၏ context အလိုက် စကားလုံးများကို ကိုင်တွယ်သည်။ မော်ဒယ်များသည် တုံ့ပြန်ညွှန်ကြားချက်ကိုယူပြီး ထည့်သွင်းချက်ကို တိုကင်စာရင်းတစ်ခုအဖြစ် ပြောင်းလဲကာ တုံ့ပြန်ညွှန်ကြားချက်ကို လုပ်ဆောင်ပြီး ခန့်မှန်းထားသော တိုကင်များကို တုံ့ပြန်ချက်တွင် ကျွန်ုပ်တို့မြင်ရသည့် စကားလုံးများအဖြစ် ပြန်ပြောင်းသည်။
ကျွန်ုပ်တို့အတွက် တူညီသော စကားလုံးနှစ်လုံးကဲ့သို့ ထင်ရနိုင်သည့်အရာသည် စာသားအတွင်း ၎င်းတို့ဖွဲ့စည်းပုံအလိုက် ကွဲပြားသော တိုကင်များအဖြစ် ထုတ်လုပ်နိုင်သည်။ စာသားအတွင်းရှိ context ပေါ်မူတည်၍ API က ‘red’ စကားလုံးအတွက် တိုကင်တန်ဖိုးများကို မည်သို့ထုတ်လုပ်သည်ကို စဉ်းစားကြည့်ပါ-
အထက်ပါ ပထမဥပမာတွင် ‘ red’ အတွက် တိုကင် “2266” သည် နောက်ကပ်နေရာလွတ်တစ်ခု ပါဝင်သည် (မှတ်ချက်- ဤတိုကင် ID များသည် သရုပ်ပြရည်ရွယ်ချက်အတွက် ဥပမာများဖြစ်သည်)။
‘ Red’ အတွက် တိုကင် “2296” (ရှေ့တွင် နေရာလွတ်ပါပြီး စာလုံးအကြီးဖြင့် စထားသော) သည် စာလုံးအသေးဖြင့် ‘ red’ အတွက် တိုကင် “2266” နှင့် ကွဲပြားသည်။
‘Red’ ကို ဝါကျအစတွင် အသုံးပြုသည့်အခါ ထုတ်လုပ်ထားသော တိုကင်တွင် ရှေ့ကပ်နေရာလွတ် မပါဝင်ပါ။ တိုကင် “7738” သည် ယခင်စကားလုံးဥပမာနှစ်ခုနှင့် ကွဲပြားသည်။
လေ့လာတွေ့ရှိချက်များ-
တိုကင်တစ်ခု ဖြစ်နိုင်ခြေ/အသုံးများမှု ပိုမြင့်လေလေ ၎င်းအား သတ်မှတ်ပေးသည့် တိုကင်နံပါတ် ပိုနိမ့်လေလေ ဖြစ်သည်-
ပုဒ်မအတွက် ထုတ်လုပ်သော တိုကင်သည် ဝါကျ 3 ကြောင်းလုံးတွင် တူညီသည် (“13”)။ အကြောင်းမှာ context အရ corpus data တစ်လျှောက် ပုဒ်မကို အတော်လေး ဆင်တူစွာ အသုံးပြုထားသောကြောင့်ဖြစ်သည်။
‘red’ အတွက် ထုတ်လုပ်သော တိုကင်သည် ဝါကျအတွင်း ၎င်း၏နေရာပေါ် မူတည်၍ ကွဲပြားသည်-
ဝါကျအလယ်တွင် စာလုံးအသေး- ‘ red’ - (တိုကင်- “2266”)
ဝါကျအလယ်တွင် စာလုံးအကြီး- ‘ Red’ - (တိုကင်- “2297”)
ဝါကျအစတွင် စာလုံးအကြီး- ‘Red’ - (တိုကင်- “7738”)
