در ۲۵ ژانویهٔ ۲۰۲۴، دو مدل امبدینگ جدید منتشر کردیم: text-embedding-3-small و text-embedding-3-large. اینها جدیدترین و پربازدهترین مدلهای امبدینگ ما هستند، با هزینههای کمتر، عملکرد چندزبانهٔ بهتر، و پارامتر جدیدی برای کوتاه کردن امبدینگها. بیشتر بخوانید.
جدیدترین مدلهای امبدینگ چه تفاوتی دارند؟
جدیدترین مدلهای v3 ما در بنچمارکهای رایج، با هزینهای کمتر، عملکرد قویتری ارائه میکنند. میتوانید دربارهٔ بهبودهای عملکرد در پست اعلامیه در وبلاگ و مستندات توسعهدهندگان بیشتر بخوانید.
چگونه میتوانم پیش از امبد کردن یک رشته بفهمم چند توکن خواهد داشت؟
میتوانید از بستهٔ Tiktoken شرکت OpenAI استفاده کنید تا بررسی کنید یک رشته چند توکن خواهد داشت. در راهنمای توسعهدهندگان امبدینگها ما بیشتر بخوانید.
چگونه میتوانم K نزدیکترین بردار امبدینگ را بهسرعت بازیابی کنم؟
برای جستوجوی سریع در میان تعداد زیادی بردار، توصیه میکنیم از یک پایگاهدادهٔ برداری استفاده کنید.
از کدام تابع فاصله باید استفاده کنم؟
خروجیهای امبدینگ API OpenAI بهطور پیشفرض با L2 به طول ۱ نرمالسازی میشوند، از جمله پس از کوتاهسازی با پارامتر dimensions، که یعنی:
امبدینگهای OpenAI به طول ۱ نرمالسازی شدهاند، که یعنی:
شباهت کسینوسی را میتوان کمی سریعتر، فقط با استفاده از ضرب داخلی محاسبه کرد
شباهت کسینوسی و فاصلهٔ اقلیدسی رتبهبندیهای یکسانی به دست خواهند داد
