OpenAI
Ova stranica je mašinski prevedena. Pogledaj originalni članak na engleskom jeziku.

Česta pitanja o embeddingima

Česta pitanja o novim i poboljšanim embedding modelima

Ažurirano: 23 hours ago

Dana 25. januara 2024. objavili smo dva nova modela za vektorske reprezentacije: text-embedding-3-small i text-embedding-3-large. Ovo su naši najnoviji i najučinkovitiji modeli za vektorske reprezentacije, uz niže troškove, bolje višejezičke performanse i novi parametar za skraćivanje vektorskih reprezentacija. Saznajte više.

Šta je drugačije kod najnovijih embedding modela?

Naši najnoviji v3 modeli pružaju bolje performanse na uobičajenim referentnim testovima po nižoj cijeni. Više o poboljšanjima performansi možete pročitati u objavi na blogu s najavom i dokumentaciji za programere.

Kako mogu znati koliko će tokena imati niz znakova prije nego što pokušam kreirati embedding za njega?

Možete koristiti OpenAI-jev paket Tiktoken da provjerite koliko će tokena imati niz znakova. Saznajte više u našem vodiču za programere o embeddingima.

Kako mogu brzo dohvatiti K najbližih embedding vektora?

Za brzo pretraživanje velikog broja vektora preporučujemo korištenje vektorske baze podataka.

Koju funkciju udaljenosti trebam koristiti?

Izlazi embeddinga iz OpenAI API-ja su po zadanim postavkama L2-normalizirani na dužinu 1, uključujući i nakon skraćivanja pomoću parametra dimensions, što znači da:

OpenAI embeddingi su normalizirani na dužinu 1, što znači da:

  • Kosinusna sličnost može se izračunati nešto brže koristeći samo skalarni proizvod

  • Kosinusna sličnost i euklidska udaljenost dat će identična rangiranja

Da li je ovaj članak bio koristan?