OpenAI
Halaman ini diterjemah oleh mesin. Lihat artikel asal dalam bahasa Inggeris.

Soalan Lazim Embedding

Soalan lazim untuk model embedding baharu dan dipertingkat

Dikemas kini: 9 days ago

Pada 25 Januari 2024, kami melancarkan dua model embedding baharu: text-embedding-3-small dan text-embedding-3-large. Ini ialah model embedding kami yang terbaharu dan paling berprestasi, dengan kos lebih rendah, prestasi berbilang bahasa lebih tinggi, serta parameter baharu untuk memendekkan embedding. Baca selanjutnya.

Apakah yang berbeza tentang model embedding terkini?

Model v3 terkini kami memberikan prestasi yang lebih kukuh pada penanda aras umum pada harga yang lebih rendah. Anda boleh membaca lebih lanjut tentang peningkatan prestasi dalam catatan blog pengumuman dan dokumentasi pembangun.

Bagaimanakah saya boleh tahu bilangan token bagi sesuatu rentetan sebelum saya cuba menjana embedding untuknya?

Anda boleh menggunakan pakej Tiktoken OpenAI untuk menyemak berapa banyak token yang akan ada pada sesuatu rentetan. Ketahui lebih lanjut dalam panduan pembangun embeddings kami.

Bagaimanakah saya boleh mendapatkan K vektor embedding terdekat dengan cepat?

Untuk mencari merentas banyak vektor dengan cepat, kami mengesyorkan penggunaan pangkalan data vektor.

Fungsi jarak manakah yang patut saya gunakan?

Output embedding API OpenAI dinormalkan L2 kepada panjang 1 secara lalai, termasuk selepas dipendekkan dengan parameter dimensions, yang bermaksud bahawa:

Embedding OpenAI dinormalkan kepada panjang 1, yang bermaksud bahawa:

  • Keserupaan kosinus boleh dikira sedikit lebih pantas dengan hanya menggunakan hasil darab titik

  • Keserupaan kosinus dan jarak Euclidean akan menghasilkan kedudukan yang sama

Adakah artikel ini membantu?