२५ जानेवारी २०२४ रोजी आम्ही दोन नवीन एम्बेडिंग मॉडेल जारी केली: text-embedding-3-small आणि text-embedding-3-large. ही आमची सर्वांत नवीन आणि सर्वाधिक कार्यक्षम एम्बेडिंग मॉडेल आहेत. त्यांचा खर्च कमी आहे, बहुभाषिक कामगिरी अधिक चांगली आहे आणि एम्बेडिंग लहान करण्यासाठी त्यांत एक नवीन मापदंड आहे. अधिक वाचा.
सर्वात अलीकडील एम्बेडिंग मॉडेलमध्ये काय वेगळे आहे?
आमची सर्वात अलीकडील v3 मॉडेल कमी किमतीत प्रचलित कसोट्यांवर अधिक सक्षम कार्यप्रदर्शन देतात. कार्यप्रदर्शनातील सुधारणांबद्दल तुम्ही घोषणेवरील ब्लॉग लेख आणि विकसक दस्तऐवजीकरण येथे अधिक वाचू शकता.
एखादी स्ट्रिंग एम्बेड करण्याचा प्रयत्न करण्यापूर्वी तिच्यात किती टोकन असतील हे मी कसे जाणून घेऊ शकतो?
एखाद्या स्ट्रिंगमध्ये किती टोकन असतील हे तपासण्यासाठी तुम्ही OpenAI चे Tiktoken पॅकेज वापरू शकता. आमच्या एम्बेडिंग विकसक मार्गदर्शिकेत अधिक जाणून घ्या.
K सर्वात जवळचे एम्बेडिंग सदिश मी पटकन कसे मिळवू शकतो?
अनेक सदिशांमध्ये पटकन शोध घेण्यासाठी, आम्ही सदिश डेटाबेस वापरण्याची शिफारस करतो.
मी कोणते अंतर फलन वापरावे?
OpenAI API मधून मिळणारी एम्बेडिंग आउटपुट मूलभूतपणे लांबी 1 पर्यंत L2-सामान्यीकृत असतात, dimensions मापदंडाने लहान केल्यानंतरही; याचा अर्थ असा की:
OpenAI एम्बेडिंग्ज लांबी 1 पर्यंत सामान्यीकृत असतात, याचा अर्थ असा की:
फक्त बिंदू गुणाकार वापरून कोसाइन समानता थोडी जलद मोजता येते
कोसाइन समानता आणि युक्लिडियन अंतर यांमुळे समान क्रमवारी मिळेल
