Fil-25 ta’ Jannar 2024 ħriġna żewġ mudelli ġodda ta’ embeddings: text-embedding-3-small u text-embedding-3-large. Dawn huma l-aktar mudelli ġodda tagħna ta’ embeddings u dawk bl-aqwa prestazzjoni, bi spejjeż aktar baxxi, prestazzjoni multilingwi ogħla u parametru ġdid biex jitqassru l-embeddings. Aqra aktar.
X’inhu differenti dwar l-aħħar mudelli tal-embedding?
L-aħħar mudelli v3 tagħna jipprovdu prestazzjoni aktar b’saħħitha fuq benchmarks komuni bi prezz imnaqqas. Tista’ taqra aktar dwar it-titjib fil-prestazzjoni fil-post tal-blog tat-tħabbira u fid-dokumentazzjoni għall-iżviluppaturi.
Kif nista’ nkun naf kemm-il token se jkollha string qabel nipprova nagħmlilha embedding?
Tista’ tuża il-pakkett Tiktoken ta’ OpenAI biex tiċċekkja kemm-il token se jkollha string. Sir af aktar fil-gwida tagħna għall-iżviluppaturi dwar l-embeddings.
Kif nista’ nirkupra malajr il-K vetturi tal-embedding l-eqreb?
Biex tfittex malajr fost ħafna vetturi, nirrakkomandaw li tuża bażi tad-data vettorjali.
Liema funzjoni tad-distanza għandi nuża?
L-outputs tal-embeddings tal-API ta’ OpenAI huma normalizzati b’L2 għal tul ta’ 1 b’mod awtomatiku, inkluż wara t-tqassir bil-parametru dimensions, li jfisser li:
L-embeddings ta’ OpenAI huma normalizzati għal tul ta’ 1, li jfisser li:
Is-similarità tal-kosinus tista’ tiġi kkalkulata kemxejn aktar malajr bl-użu ta’ prodott puntwali biss
Is-similarità tal-kosinus u d-distanza Ewklidjana se jagħtu klassifiki identiċi
