OpenAI
Ukurasa huu ulitafsiriwa na mashine. Tazama makala asili ya Kiingereza.

Maswali Yanayoulizwa Mara kwa Mara ya Embeddings

Maswali ya kawaida kuhusu miundo mipya na bora ya embedding

Ilisasishwa: 14 days ago

Tarehe 25 Januari 2024, tulitoa miundo miwili mipya ya embeddings: text-embedding-3-small na text-embedding-3-large. Hii ndiyo miundo yetu mipya zaidi na yenye utendaji bora zaidi ya embedding, ikiwa na gharama za chini, utendaji bora zaidi wa lugha nyingi, na kigezo kipya cha kufupisha embeddings. Soma zaidi.

Ni nini kilicho tofauti kuhusu miundo ya hivi karibuni ya embeddings?

Miundo yetu ya hivi karibuni ya v3 hutoa utendaji bora zaidi kwenye vipimo linganishi vya kawaida kwa bei iliyopunguzwa. Unaweza kusoma zaidi kuhusu maboresho ya utendaji katika chapisho la blogu la tangazo na hati za msanidi programu.

Ninawezaje kujua mfuatano utakuwa na tokeni ngapi kabla sijajaribu kuupachika?

Unaweza kutumia kifurushi cha Tiktoken cha OpenAI kuangalia mfuatano utakuwa na tokeni ngapi. Pata maelezo zaidi katika mwongozo wetu wa msanidi programu wa embeddings.

Ninawezaje kupata kwa haraka vekta K za embedding zilizo karibu zaidi?

Ili kutafuta haraka kwenye vekta nyingi, tunapendekeza kutumia hifadhidata ya vekta.

Ni kitendakazi gani cha umbali ninachopaswa kutumia?

Matokeo ya embedding ya OpenAI API husawazishwa kwa L2 hadi urefu wa 1 kwa chaguomsingi, ikiwemo baada ya kufupishwa kwa kigezo cha dimensions, jambo linalomaanisha kwamba:

Embeddings za OpenAI husawazishwa hadi urefu wa 1, jambo linalomaanisha kwamba:

  • Ufanano wa kosaini unaweza kukokotolewa haraka kidogo kwa kutumia zao la nukta pekee

  • Ufanano wa kosaini na umbali wa Euclidean vitatoa upangaji sawa kabisa

Je, makala haya yamekusaidia?