OpenAI
ဤစာမျက်နှာကို စက်ဖြင့် ဘာသာပြန်ထားပါသည်။ မူရင်း အင်္ဂလိပ်ဆောင်းပါးကို ကြည့်ရန်

Embeddings အမေးများသောမေးခွန်းများ

အသစ်နှင့် ပိုကောင်းလာသော embedding မော်ဒယ်များအတွက် FAQ

အပ်ဒိတ်လုပ်ထားသည်- 2 days ago

၂၀၂၄ ခုနှစ် ဇန်နဝါရီလ ၂၅ ရက်တွင် embedding မော်ဒယ်အသစ် နှစ်ခုဖြစ်သော text-embedding-3-small နှင့် text-embedding-3-large ကို ကျွန်ုပ်တို့ ထုတ်ပြန်ခဲ့ပါသည်။ ဤအရာများသည် ကုန်ကျစရိတ် နည်းပါးပြီး ဘာသာစုံ စွမ်းဆောင်ရည် ပိုမြင့်ကာ embeddings များကို တိုအောင်လုပ်ရန် parameter အသစ်ပါရှိသော ကျွန်ုပ်တို့၏ နောက်ဆုံးပေါ်နှင့် စွမ်းဆောင်ရည်အမြင့်ဆုံး embedding မော်ဒယ်များ ဖြစ်ပါသည်။ ဆက်ဖတ်ရန်

နောက်ဆုံးပေါ် embeddings မော်ဒယ်များတွင် ဘာတွေကွာခြားပါသလဲ။

ကျွန်ုပ်တို့၏ နောက်ဆုံးပေါ် v3 မော်ဒယ်များသည် စျေးနှုန်း လျှော့ချထားပြီး အများသုံး benchmark များတွင် ပိုမိုကောင်းမွန်သော စွမ်းဆောင်ရည်ကို ပေးပါသည်။ စွမ်းဆောင်ရည် တိုးတက်မှုများအကြောင်း ကြေညာချက် ဘလော့ဂ်ပို့စ် နှင့် ဆော့ဖ်ဝဲဖန်တီးသူ စာရွက်စာတမ်းများတွင် ပိုမိုဖတ်ရှုနိုင်ပါသည်။

စာကြောင်းတစ်ခုကို embed မလုပ်မီ ၎င်းတွင် တိုကင် မည်မျှရှိမည်ကို ဘယ်လို သိနိုင်မလဲ။

စာကြောင်းတစ်ခုတွင် တိုကင် မည်မျှရှိမည်ကို စစ်ဆေးရန် OpenAI ၏ Tiktoken ပက်ကေ့ဂျ်ကို အသုံးပြုနိုင်ပါသည်။ ကျွန်ုပ်တို့၏ embeddings ဆော့ဖ်ဝဲဖန်တီးသူ လမ်းညွှန်တွင် ပိုမိုလေ့လာပါ။

K ခု အနီးဆုံး embedding vector များကို မြန်မြန် ဘယ်လို ပြန်ယူနိုင်မလဲ။

vector အများအပြားအပေါ် မြန်ဆန်စွာ ရှာဖွေရန် vector database ကို အသုံးပြုရန် ကျွန်ုပ်တို့ အကြံပြုပါသည်။

မည်သည့် အကွာအဝေး function ကို အသုံးပြုသင့်ပါသလဲ။

OpenAI API embedding ရလဒ်များသည် dimensions parameter ဖြင့် တိုအောင်လုပ်ပြီးနောက် အပါအဝင် မူလအတိုင်း အလျား 1 သို့ L2-normalized လုပ်ထားသောကြောင့် ဆိုလိုသည်မှာ-

OpenAI embeddings များကို အလျား 1 သို့ normalize လုပ်ထားသောကြောင့် ဆိုလိုသည်မှာ-

  • Cosine similarity ကို dot product တစ်ခုတည်းဖြင့် အနည်းငယ် ပိုမြန်စွာ တွက်ချက်နိုင်သည်

  • Cosine similarity နှင့် Euclidean distance တို့သည် တူညီသော အဆင့်အစဉ်များကို ရရှိစေမည်

ဤဆောင်းပါးသည် အထောက်အကူ ဖြစ်ပါသလား။