OpenAI
Ova stranica je mašinski prevedena. Pogledaj originalni članak na engleskom jeziku.

Česta pitanja o embeddingima

Česta pitanja o novim i poboljšanim embedding modelima

Ažurirano: 8 days ago

Dana 25. januara 2024. objavili smo dva nova embedding modela: text-embedding-3-small i text-embedding-3-large. Ovo su naši najnoviji i najmoćniji embedding modeli, s nižim troškovima, boljim višejezičnim performansama i novim parametrom za skraćivanje embeddinga. Pročitajte više.

Šta je drugačije kod najnovijih embedding modela?

Naši najnoviji v3 modeli pružaju bolje performanse na uobičajenim referentnim testovima po nižoj cijeni. Više o poboljšanjima performansi možete pročitati u objavi na blogu s najavom i dokumentaciji za programere.

Kako mogu znati koliko će tokena imati niz znakova prije nego što pokušam kreirati embedding za njega?

Možete koristiti OpenAI-jev paket Tiktoken da provjerite koliko će tokena imati niz znakova. Saznajte više u našem vodiču za programere o embeddingima.

Kako mogu brzo dohvatiti K najbližih embedding vektora?

Za brzo pretraživanje velikog broja vektora preporučujemo korištenje vektorske baze podataka.

Koju funkciju udaljenosti trebam koristiti?

Izlazi embeddinga iz OpenAI API-ja su po zadanim postavkama L2-normalizirani na dužinu 1, uključujući i nakon skraćivanja pomoću parametra dimensions, što znači da:

OpenAI embeddingi su normalizirani na dužinu 1, što znači da:

  • Kosinusna sličnost može se izračunati nešto brže koristeći samo skalarni proizvod

  • Kosinusna sličnost i euklidska udaljenost dat će identična rangiranja

Da li je ovaj članak bio koristan?