OpenAI
Din il-paġna ġiet tradotta awtomatikament bl-IA. Ara l-artiklu oriġinali bl-Ingliż.

Mistoqsijiet frekwenti dwar l-embeddings

Mistoqsijiet frekwenti dwar il-mudelli ta’ embedding il-ġodda u mtejba

Aġġornat: last month

Fil-25 ta’ Jannar 2024 ħriġna żewġ mudelli ġodda ta’ embeddings: text-embedding-3-small u text-embedding-3-large. Dawn huma l-aktar mudelli ġodda tagħna ta’ embeddings u dawk bl-aqwa prestazzjoni, bi spejjeż aktar baxxi, prestazzjoni multilingwi ogħla u parametru ġdid biex jitqassru l-embeddings. Aqra aktar.

X’inhu differenti dwar l-aħħar mudelli tal-embedding?

L-aħħar mudelli v3 tagħna jipprovdu prestazzjoni aktar b’saħħitha fuq benchmarks komuni bi prezz imnaqqas. Tista’ taqra aktar dwar it-titjib fil-prestazzjoni fil-post tal-blog tat-tħabbira u fid-dokumentazzjoni għall-iżviluppaturi.

Kif nista’ nkun naf kemm-il token se jkollha string qabel nipprova nagħmlilha embedding?

Tista’ tuża il-pakkett Tiktoken ta’ OpenAI biex tiċċekkja kemm-il token se jkollha string. Sir af aktar fil-gwida tagħna għall-iżviluppaturi dwar l-embeddings.

Kif nista’ nirkupra malajr il-K vetturi tal-embedding l-eqreb?

Biex tfittex malajr fost ħafna vetturi, nirrakkomandaw li tuża bażi tad-data vettorjali.

Liema funzjoni tad-distanza għandi nuża?

L-outputs tal-embeddings tal-API ta’ OpenAI huma normalizzati b’L2 għal tul ta’ 1 b’mod awtomatiku, inkluż wara t-tqassir bil-parametru dimensions, li jfisser li:

L-embeddings ta’ OpenAI huma normalizzati għal tul ta’ 1, li jfisser li:

  • Is-similarità tal-kosinus tista’ tiġi kkalkulata kemxejn aktar malajr bl-użu ta’ prodott puntwali biss

  • Is-similarità tal-kosinus u d-distanza Ewklidjana se jagħtu klassifiki identiċi

Dan l-artiklu kien ta’ għajnuna?