Στις 25 Ιανουαρίου 2024 κυκλοφορήσαμε δύο νέα μοντέλα embeddings: text-embedding-3-small και text-embedding-3-large. Αυτά είναι τα νεότερα και πιο αποδοτικά μοντέλα embedding μας, με χαμηλότερο κόστος, υψηλότερες επιδόσεις σε πολλές γλώσσες και μια νέα παράμετρο για τη συντόμευση των embeddings. Διαβάστε περισσότερα.
Τι διαφέρει στα πιο πρόσφατα μοντέλα embeddings;
Τα πιο πρόσφατα μοντέλα v3 μας προσφέρουν ισχυρότερες επιδόσεις σε κοινά benchmarks, σε μειωμένη τιμή. Μπορείτε να διαβάσετε περισσότερα σχετικά με τις βελτιώσεις επιδόσεων στην ανάρτηση ιστολογίου ανακοίνωσης και στην τεκμηρίωση για προγραμματιστές.
Πώς μπορώ να ξέρω πόσα token θα έχει μια συμβολοσειρά προτού προσπαθήσω να τη μετατρέψω σε embedding;
Μπορείτε να χρησιμοποιήσετε το πακέτο Tiktoken της OpenAI για να ελέγξετε πόσα token θα έχει μια συμβολοσειρά. Μάθετε περισσότερα στον οδηγό για προγραμματιστές σχετικά με τα embeddings.
Πώς μπορώ να ανακτήσω γρήγορα τα K πλησιέστερα διανύσματα embedding;
Για γρήγορη αναζήτηση σε πολλά διανύσματα, συνιστούμε τη χρήση μιας βάσης δεδομένων διανυσμάτων.
Ποια συνάρτηση απόστασης πρέπει να χρησιμοποιήσω;
Οι έξοδοι embedding του OpenAI API είναι από προεπιλογή κανονικοποιημένες κατά L2 σε μήκος 1, ακόμη και μετά τη συντόμευση με την παράμετρο dimensions, που σημαίνει ότι:
Τα embeddings της OpenAI είναι κανονικοποιημένα σε μήκος 1, που σημαίνει ότι:
Η ομοιότητα συνημιτόνου μπορεί να υπολογιστεί λίγο πιο γρήγορα χρησιμοποιώντας απλώς ένα βαθμωτό γινόμενο
Η ομοιότητα συνημιτόνου και η Ευκλείδεια απόσταση θα δώσουν πανομοιότυπες κατατάξεις
