Dana 25. januara 2024. objavili smo dva nova embedding modela: text-embedding-3-small i text-embedding-3-large. Ovo su naši najnoviji i najmoćniji embedding modeli, s nižim troškovima, boljim višejezičnim performansama i novim parametrom za skraćivanje embeddinga. Pročitajte više.
Šta je drugačije kod najnovijih embedding modela?
Naši najnoviji v3 modeli pružaju bolje performanse na uobičajenim referentnim testovima po nižoj cijeni. Više o poboljšanjima performansi možete pročitati u objavi na blogu s najavom i dokumentaciji za programere.
Kako mogu znati koliko će tokena imati niz znakova prije nego što pokušam kreirati embedding za njega?
Možete koristiti OpenAI-jev paket Tiktoken da provjerite koliko će tokena imati niz znakova. Saznajte više u našem vodiču za programere o embeddingima.
Kako mogu brzo dohvatiti K najbližih embedding vektora?
Za brzo pretraživanje velikog broja vektora preporučujemo korištenje vektorske baze podataka.
Koju funkciju udaljenosti trebam koristiti?
Izlazi embeddinga iz OpenAI API-ja su po zadanim postavkama L2-normalizirani na dužinu 1, uključujući i nakon skraćivanja pomoću parametra dimensions, što znači da:
OpenAI embeddingi su normalizirani na dužinu 1, što znači da:
Kosinusna sličnost može se izračunati nešto brže koristeći samo skalarni proizvod
Kosinusna sličnost i euklidska udaljenost dat će identična rangiranja
