OpenAI
ဤစာမျက်နှာကို စက်ဖြင့် ဘာသာပြန်ထားပါသည်။ မူရင်း အင်္ဂလိပ်ဆောင်းပါးကို ကြည့်ရန်

တိုကင်များဆိုတာ ဘာလဲ၊ ဘယ်လိုရေတွက်မလဲ?

အပ်ဒိတ်လုပ်ထားသည်- 2 days ago

တိုကင်များဆိုတာ ဘာလဲ။

တိုကင်များသည် OpenAI မော်ဒယ်များက လုပ်ဆောင်သည့် စာသား၏ အခြေခံတည်ဆောက်မှု အစိတ်အပိုင်းများဖြစ်သည်။ ဘာသာစကားနှင့် အကြောင်းအရာပေါ် မူတည်၍ ၎င်းတို့သည် စာလုံးတစ်လုံးတည်းလောက် တိုနိုင်သလို စကားလုံးတစ်လုံးလုံးလောက် ရှည်နိုင်သည်။ နေရာလွတ်များ၊ ပုဒ်ဖြတ်ပုဒ်ရပ်များနှင့် စကားလုံးအစိတ်အပိုင်းများအားလုံးသည် တိုကင်အရေအတွက်တွင် ပါဝင်သည်။ ဤသည်မှာ တုံ့ပြန်ချက်တစ်ခု ထုတ်လုပ်မပေးမီ API က သင့်စာသားကို အတွင်းပိုင်းတွင် အပိုင်းခွဲပုံဖြစ်သည်။

အင်္ဂလိပ်ဘာသာအတွက် အသုံးဝင်သော ခန့်မှန်းစည်းမျဉ်းများ-

  • တိုကင် 1 ခု ≈ စာလုံး 4 လုံး

  • တိုကင် 1 ခု ≈ စကားလုံးတစ်လုံး၏ ¾

  • တိုကင် 100 ခု ≈ စကားလုံး 75 လုံး

  • ဝါကျ 1–2 ကြောင်း ≈ တိုကင် 30 ခု

  • စာပိုဒ် 1 ပိုဒ် ≈ တိုကင် 100 ခု

  • စကားလုံး ~1,500 လုံး ≈ တိုကင် 2,048 ခု

တိုကင်လုပ်ခြင်းသည် မော်ဒယ်နှင့် encoding အလိုက် ကွဲပြားသည်။ သင့်ရည်မှန်းထားသော မော်ဒယ်အတွက် တိကျသောအရေအတွက်ရရန် Tokenizer ကိရိယာ သို့မဟုတ် tiktoken.encoding_for_model(model) ကို အသုံးပြုပါ။

ဥပမာများ

အနီးစပ်ဆုံး တိုကင်အရေအတွက်များနှင့်အတူ လက်တွေ့အသုံးပြုသော စာသားနမူနာအချို့မှာ-

  • Wayne Gretzky ၏ ကိုးကားချက် “မင်းမပစ်လိုက်တဲ့ ပစ်ချက်တွေရဲ့ 100% ကို မင်းလွဲမယ်” = တိုကင် 11 ခု

  • OpenAI Charter = တိုကင် 476 ခု

  • အမေရိကန် လွတ်လပ်ရေးကြေညာစာတမ်း = တိုကင် 1,695 ခု

တိုကင်အရေအတွက်များကို တွက်ချက်ပုံ

သင် API သို့ စာသားပို့သည့်အခါ-

  1. စာသားကို တိုကင်များအဖြစ် ခွဲသည်။

  2. မော်ဒယ်သည် ဤတိုကင်များကို လုပ်ဆောင်သည်။

  3. တုံ့ပြန်ချက်ကို တိုကင်အစဉ်တစ်ခုအဖြစ် ထုတ်လုပ်ပြီးနောက် စာသားအဖြစ် ပြန်လည်ပြောင်းလဲသည်။

တိုကင်အသုံးပြုမှုကို အမျိုးအစားအချို့ဖြင့် ခြေရာခံထားသည်-

  • ထည့်သွင်း တိုကင်များ – သင့်တောင်းဆိုမှုရှိ တိုကင်များ။

  • ထွက်လာသည့် တိုကင်များ – တုံ့ပြန်ချက်တွင် ထုတ်လုပ်ထားသော တိုကင်များ။

  • ကက်ရှ်ထားသော တိုကင်များ – စကားပြောမှတ်တမ်းတွင် ပြန်လည်အသုံးပြုသည့် တိုကင်များ (အများအားဖြင့် လျှော့ထားသော နှုန်းထားဖြင့် ကောက်ခံသည်)။

  • ကျိုးကြောင်းသင့်လျော်စွာ စဉ်းစားပေးသော တိုကင်များ – အဆင့်မြင့် မော်ဒယ်အချို့တွင် နောက်ဆုံးထွက်ရလဒ် မထုတ်မီ အတွင်းပိုင်း၌ အပို “စဉ်းစားမှုအဆင့်များ” ပါဝင်သည်။

ဤအရေအတွက်များသည် သင့် API တုံ့ပြန်ချက်၏ metadata တွင် ပေါ်လာပြီး ငွေကောက်ခံမှုနှင့် အသုံးပြုမှုခြေရာခံမှုအတွက် အသုံးပြုသည်။

တိုကင်လုပ်ခြင်းကို ပိုမိုလေ့လာရန် ကျွန်ုပ်တို့၏ အပြန်အလှန်လုပ်ဆောင်နိုင်သော Tokenizer ကိရိယာကို အသုံးပြုနိုင်ပြီး၊ ၎င်းက တိုကင်အရေအတွက်ကို တွက်ချက်ရန်နှင့် စာသားကို တိုကင်များအဖြစ် မည်သို့ခွဲထားသည်ကို ကြည့်ရှုရန် ခွင့်ပြုသည်။

တစ်နည်းအားဖြင့် စာသားကို ပရိုဂရမ်ဖြင့် တိုကင်လုပ်လိုပါက OpenAI မော်ဒယ်များအတွက် အထူးအသုံးပြုသော မြန်ဆန်သည့် BPE tokenizer အဖြစ် Tiktoken ကို အသုံးပြုပါ။

တိုကင်ကန့်သတ်ချက်များ

မော်ဒယ်တစ်ခုစီတွင် ပေါင်းစပ်တိုကင်ကန့်သတ်ချက် အများဆုံးတစ်ခု (ထည့်သွင်းမှု + ထွက်ရလဒ်) ရှိသည်။ လက်ရှိ စွမ်းရည်မြင့် မော်ဒယ်များသည် context တွင် တိုကင် သိန်းနှင့်ချီအထိ ပံ့ပိုးနိုင်သော်လည်း လက်တွေ့ကန့်သတ်ချက်များမှာ မော်ဒယ်ဗားရှင်းနှင့် သင့်အသုံးပြုမှုအဆင့်ပေါ် မူတည်၍ ကွဲပြားနိုင်သည်။

ကန့်သတ်ချက်ကို ကျော်လွန်ပါက သင်လုပ်နိုင်သည်မှာ-

  • တုံ့ပြန်ညွှန်ကြားချက်များကို တိုစေပါ သို့မဟုတ် ပြန်လည်ရေးသားပါ။

  • စာသားကြီးများကို အပိုင်းငယ်များအဖြစ် ခွဲပါ။

  • ထည့်သွင်းချက်များကို မပို့မီ အကျဉ်းချုပ်ပါ သို့မဟုတ် ကြိုတင်လုပ်ဆောင်ပါ။

တိုကင်စျေးနှုန်း

API အသုံးပြုမှုကို တိုကင်အလိုက် စျေးနှုန်းသတ်မှတ်ပြီး မော်ဒယ်အလိုက်နှင့် တိုကင်များသည် ထည့်သွင်းမှု၊ ထွက်ရလဒ် သို့မဟုတ် ကက်ရှ်ထားသော တိုကင်များ ဖြစ်/မဖြစ်အလိုက် ကွဲပြားသည်။ လက်ရှိနှုန်းထားများအတွက် OpenAI ၏ စျေးနှုန်းစာမျက်နှာကို ကြည့်ပါ။ အချို့သော ကျိုးကြောင်းသင့်လျော်စွာ စဉ်းစားပေးသော မော်ဒယ်များသည် အတွင်းပိုင်းတွင် တိုကင်များ ပိုမိုအသုံးပြုနိုင်သော်လည်း ပြီးမြောက်သော လုပ်ငန်းတစ်ခုစီအတွက် လိုအပ်သည့် တိုကင်အရေအတွက်ကို လျှော့ချခြင်းဖြင့် ထိရောက်မှုမြှင့်တင်ရန် ရည်ရွယ်သည်။

တိုကင်များကို စူးစမ်းလေ့လာခြင်း

API သည် corpus data အတွင်းရှိ ၎င်းတို့၏ context အလိုက် စကားလုံးများကို ကိုင်တွယ်သည်။ မော်ဒယ်များသည် တုံ့ပြန်ညွှန်ကြားချက်ကိုယူပြီး ထည့်သွင်းချက်ကို တိုကင်စာရင်းတစ်ခုအဖြစ် ပြောင်းလဲကာ တုံ့ပြန်ညွှန်ကြားချက်ကို လုပ်ဆောင်ပြီး ခန့်မှန်းထားသော တိုကင်များကို တုံ့ပြန်ချက်တွင် ကျွန်ုပ်တို့မြင်ရသည့် စကားလုံးများအဖြစ် ပြန်ပြောင်းသည်။

ကျွန်ုပ်တို့အတွက် တူညီသော စကားလုံးနှစ်လုံးကဲ့သို့ ထင်ရနိုင်သည့်အရာသည် စာသားအတွင်း ၎င်းတို့ဖွဲ့စည်းပုံအလိုက် ကွဲပြားသော တိုကင်များအဖြစ် ထုတ်လုပ်နိုင်သည်။ စာသားအတွင်းရှိ context ပေါ်မူတည်၍ API က ‘red’ စကားလုံးအတွက် တိုကင်တန်ဖိုးများကို မည်သို့ထုတ်လုပ်သည်ကို စဉ်းစားကြည့်ပါ-

Sentence split into color-coded tokens with Text selected over Token IDs
Token ID output as a list of integers with the Token IDs tab selected

အထက်ပါ ပထမဥပမာတွင် ‘ red’ အတွက် တိုကင် “2266” သည် နောက်ကပ်နေရာလွတ်တစ်ခု ပါဝင်သည် (မှတ်ချက်- ဤတိုကင် ID များသည် သရုပ်ပြရည်ရွယ်ချက်အတွက် ဥပမာများဖြစ်သည်)။

Sentence split into color-coded token blocks: My favorite color is Red.
Tokenizer output with Token IDs selected and a list of numeric token IDs

‘ Red’ အတွက် တိုကင် “2296” (ရှေ့တွင် နေရာလွတ်ပါပြီး စာလုံးအကြီးဖြင့် စထားသော) သည် စာလုံးအသေးဖြင့် ‘ red’ အတွက် တိုကင် “2266” နှင့် ကွဲပြားသည်။

Tokenizer example splitting “Red is my favorite color.” into color-coded tokens
Tokenizer output with Token IDs selected and a list of token ID numbers

‘Red’ ကို ဝါကျအစတွင် အသုံးပြုသည့်အခါ ထုတ်လုပ်ထားသော တိုကင်တွင် ရှေ့ကပ်နေရာလွတ် မပါဝင်ပါ။ တိုကင် “7738” သည် ယခင်စကားလုံးဥပမာနှစ်ခုနှင့် ကွဲပြားသည်။

လေ့လာတွေ့ရှိချက်များ-

တိုကင်တစ်ခု ဖြစ်နိုင်ခြေ/အသုံးများမှု ပိုမြင့်လေလေ ၎င်းအား သတ်မှတ်ပေးသည့် တိုကင်နံပါတ် ပိုနိမ့်လေလေ ဖြစ်သည်-

  • ပုဒ်မအတွက် ထုတ်လုပ်သော တိုကင်သည် ဝါကျ 3 ကြောင်းလုံးတွင် တူညီသည် (“13”)။ အကြောင်းမှာ context အရ corpus data တစ်လျှောက် ပုဒ်မကို အတော်လေး ဆင်တူစွာ အသုံးပြုထားသောကြောင့်ဖြစ်သည်။

  • ‘red’ အတွက် ထုတ်လုပ်သော တိုကင်သည် ဝါကျအတွင်း ၎င်း၏နေရာပေါ် မူတည်၍ ကွဲပြားသည်-

    • ဝါကျအလယ်တွင် စာလုံးအသေး- ‘ red’ - (တိုကင်- “2266”)

    • ဝါကျအလယ်တွင် စာလုံးအကြီး- ‘ Red’ - (တိုကင်- “2297”)

    • ဝါကျအစတွင် စာလုံးအကြီး- ‘Red’ - (တိုကင်- “7738”)

ဤဆောင်းပါးသည် အထောက်အကူ ဖြစ်ပါသလား။