OpenAI
این صفحه به‌صورت ماشینی ترجمه شده است. مقاله اصلی انگلیسی را مشاهده کنید.

پرسش‌های متداول Embeddings

پرسش‌های متداول برای مدل‌های embedding جدید و بهبودیافته

به‌روزرسانی: 12 days ago

در ۲۵ ژانویهٔ ۲۰۲۴، دو مدل امبدینگ جدید منتشر کردیم: text-embedding-3-small و text-embedding-3-large. این‌ها جدیدترین و پربازده‌ترین مدل‌های امبدینگ ما هستند، با هزینه‌های کمتر، عملکرد چندزبانهٔ بهتر، و پارامتر جدیدی برای کوتاه کردن امبدینگ‌ها. بیشتر بخوانید.

جدیدترین مدل‌های امبدینگ چه تفاوتی دارند؟

جدیدترین مدل‌های v3 ما در بنچمارک‌های رایج، با هزینه‌ای کمتر، عملکرد قوی‌تری ارائه می‌کنند. می‌توانید دربارهٔ بهبودهای عملکرد در پست اعلامیه در وبلاگ و مستندات توسعه‌دهندگان بیشتر بخوانید.

چگونه می‌توانم پیش از امبد کردن یک رشته بفهمم چند توکن خواهد داشت؟

می‌توانید از بستهٔ Tiktoken شرکت OpenAI استفاده کنید تا بررسی کنید یک رشته چند توکن خواهد داشت. در راهنمای توسعه‌دهندگان امبدینگ‌ها ما بیشتر بخوانید.

چگونه می‌توانم K نزدیک‌ترین بردار امبدینگ را به‌سرعت بازیابی کنم؟

برای جست‌وجوی سریع در میان تعداد زیادی بردار، توصیه می‌کنیم از یک پایگاه‌دادهٔ برداری استفاده کنید.

از کدام تابع فاصله باید استفاده کنم؟

خروجی‌های امبدینگ API OpenAI به‌طور پیش‌فرض با L2 به طول ۱ نرمال‌سازی می‌شوند، از جمله پس از کوتاه‌سازی با پارامتر dimensions، که یعنی:

امبدینگ‌های OpenAI به طول ۱ نرمال‌سازی شده‌اند، که یعنی:

  • شباهت کسینوسی را می‌توان کمی سریع‌تر، فقط با استفاده از ضرب داخلی محاسبه کرد

  • شباهت کسینوسی و فاصلهٔ اقلیدسی رتبه‌بندی‌های یکسانی به دست خواهند داد

آیا این مقاله مفید بود؟