OpenAI
Αυτή η σελίδα μεταφράστηκε αυτόματα. Δείτε το πρωτότυπο άρθρο στα αγγλικά.

Πώς αναπτύσσονται το ChatGPT και τα βασικά μας μοντέλα

Μάθετε περισσότερα για το πώς αναπτύσσουμε τα μοντέλα μας και τα εφαρμόζουμε σε προϊόντα όπως το ChatGPT

Τελευταία ενημέρωση: 8 days ago

Τα θεμελιώδη μοντέλα της OpenAI, συμπεριλαμβανομένων των μοντέλων στα οποία βασίζεται το ChatGPT, αναπτύσσονται χρησιμοποιώντας τρεις κύριες πηγές πληροφοριών: (1) πληροφορίες που είναι δημόσια διαθέσιμες στο διαδίκτυο, (2) πληροφορίες στις οποίες αποκτούμε πρόσβαση μέσω συνεργασιών με τρίτους και (3) πληροφορίες που παρέχουν ή δημιουργούν οι χρήστες μας, οι ανθρώπινοι εκπαιδευτές και οι ερευνητές.

Η ανάπτυξη θεμελιωδών μοντέλων, όπως εκείνων που χρησιμοποιούνται στο ChatGPT, περιλαμβάνει διάφορα στάδια, όπως την προετοιμασία δεδομένων εκπαίδευσης, την προεκπαίδευση και τη μετεκπαίδευση, καθώς και τη συνεχή αξιολόγηση και βελτίωση μετά τη διάθεση. Διαφορετικοί τύποι πληροφοριών μπορούν να χρησιμοποιηθούν σε αυτά τα στάδια για διάφορους σκοπούς, μεταξύ άλλων για τη βελτίωση της απόδοσης, της αξιοπιστίας και της ασφάλειας των μοντέλων. 

Αυτό το άρθρο παρέχει μια επισκόπηση των πληροφοριών που χρησιμοποιούμε για να βοηθήσουμε στην ανάπτυξη αυτών των μοντέλων, του τρόπου με τον οποίο συλλέγουμε και χρησιμοποιούμε αυτές τις πληροφορίες σε συμμόρφωση με τη νομοθεσία περί απορρήτου, καθώς και των μέτρων προστασίας που εφαρμόζουμε σε όλη τη διαδικασία εκπαίδευσης. Για να κατανοήσετε πώς συλλέγουμε και χρησιμοποιούμε πληροφορίες από τους χρήστες των υπηρεσιών μας, συμπεριλαμβανομένου του τρόπου εξαίρεσης από τη χρήση των συνομιλιών ChatGPT για τη βελτίωση των μοντέλων μας, ανατρέξτε στην πολιτική απορρήτου μας και σε αυτό το άρθρο του κέντρου βοήθειας.

Τι είναι το ChatGPT και πώς λειτουργεί;

Το ChatGPT είναι μια υπηρεσία βασισμένη στην τεχνητή νοημοσύνη, στην οποία μπορείτε να έχετε πρόσβαση μέσω διαδικτύου ή εφαρμογής. Μπορείτε να χρησιμοποιήσετε το ChatGPT για ένα ευρύ φάσμα εργασιών, όπως οργάνωση και σύνοψη πληροφοριών, βοήθεια με μεταφράσεις, υποστήριξη στον προγραμματισμό, την έρευνα και την ανάλυση, ολοκλήρωση εργασιών πολλών βημάτων σε διάφορα εργαλεία, ανάλυση ή δημιουργία εικόνων, έμπνευση για δημιουργικότητα και ιδέες, καθώς και άλλες καθημερινές δραστηριότητες. Το ChatGPT έχει σχεδιαστεί ώστε να κατανοεί και να απαντά σε ερωτήσεις και οδηγίες χρηστών, μαθαίνοντας μοτίβα από μεγάλες ποσότητες πληροφοριών, όπως κείμενο, εικόνες, ήχος και βίντεο. 

Κατά την εκπαίδευση, το μοντέλο αναλύει σχέσεις μέσα σε αυτά τα δεδομένα—όπως το πώς εμφανίζονται συνήθως μαζί οι λέξεις στο συγκείμενο—και χρησιμοποιεί αυτή την κατανόηση για να προβλέψει την επόμενη πιθανότερη λέξη όταν δημιουργεί μια απάντηση, μία λέξη κάθε φορά. Το κείμενο μπορεί να μετατραπεί σε μικρότερες μονάδες, που μερικές φορές ονομάζονται «tokens» και μπορεί να αντιπροσωπεύουν ολόκληρες λέξεις, τμήματα λέξεων ή σημεία στίξης. Τα token είναι τα δομικά στοιχεία του κειμένου που επεξεργάζεται το μοντέλο. Αντίστοιχα, τα μοντέλα που δημιουργούν άλλες μορφές περιεχομένου, όπως εικόνες, μαθαίνουν μοτίβα στον τρόπο με τον οποίο τα pixel σχετίζονται μεταξύ τους και με τις αντίστοιχες λεζάντες στα δεδομένα εκπαίδευσης.

Για παράδειγμα, κατά τη διαδικασία μάθησης του μοντέλου (γνωστή ως «εκπαίδευση»), μπορεί να ζητηθεί από το μοντέλο να συμπληρώσει μια πρόταση όπως: «Αντί να στρίψει αριστερά, εκείνη έστριψε ___». Στα πρώτα στάδια της εκπαίδευσης, οι απαντήσεις του είναι σε μεγάλο βαθμό τυχαίες. Ωστόσο, καθώς το μοντέλο επεξεργάζεται και μαθαίνει από μεγάλο όγκο κειμένου, γίνεται καλύτερο στην αναγνώριση μοτίβων και στην πρόβλεψη της πιθανότερης επόμενης λέξης. Αυτή η διαδικασία επαναλαμβάνεται σε εκατομμύρια προτάσεις, ώστε να βελτιώνεται η κατανόησή του και να αυξάνεται η ακρίβειά του.

Επειδή υπάρχουν πολλοί εύλογοι τρόποι να συμπληρωθεί μια πρόταση—όπως «Αντί να στρίψει αριστερά, εκείνη έστριψε δεξιά», «γύρω» ή «πίσω»—υπάρχει ένα εγγενές στοιχείο τυχαιότητας στον τρόπο με τον οποίο απαντά το μοντέλο. Ως αποτέλεσμα, η ίδια ερώτηση μπορεί να δώσει διαφορετικές απαντήσεις σε διαφορετικά ερωτήματα.

Τα μοντέλα μηχανικής μάθησης αποτελούνται από μεγάλα σύνολα αριθμών, γνωστά ως «βάρη» ή «παράμετροι», μαζί με κώδικα που ερμηνεύει και χρησιμοποιεί αυτούς τους αριθμούς. Αυτά τα μοντέλα δεν αποθηκεύουν ούτε διατηρούν αντίγραφα των δεδομένων στα οποία εκπαιδεύονται. Αντίθετα, καθώς ένα μοντέλο μαθαίνει, οι τιμές των παραμέτρων του προσαρμόζονται ελαφρώς ώστε να αντικατοπτρίζουν τα μοτίβα που έχει εντοπίσει. Στο προηγούμενο παράδειγμα, το μοντέλο βελτιώθηκε από το να προβλέπει τυχαίες λέξεις στο να κάνει ακριβέστερες προβλέψεις—όχι αποθηκεύοντας τις προτάσεις εκπαίδευσης, αλλά ενημερώνοντας τις εσωτερικές παραμέτρους του. Το μοντέλο δεν διατηρεί αντίγραφα των προτάσεων, των εικόνων ή του ήχου που επεξεργάζεται κατά την εκπαίδευση. Το ChatGPT δεν κάνει «αντιγραφή και επικόλληση» από τα δεδομένα εκπαίδευσής του—παρόμοια με έναν εκπαιδευτικό που, ύστερα από εκτενή μελέτη, μπορεί να εξηγεί έννοιες κατανοώντας τις σχέσεις μεταξύ ιδεών, χωρίς να απομνημονεύει ή να αναπαράγει κατά λέξη το αρχικό υλικό. Όταν δημιουργεί μια απάντηση σε αίτημα χρήστη, το μοντέλο χρησιμοποιεί αυτά τα μαθημένα βάρη για να προβλέψει και να δημιουργήσει νέο περιεχόμενο.

Τι είδους πληροφορίες χρησιμοποιούνται για την εκπαίδευση του ChatGPT;

Για το δημόσια διαθέσιμο περιεχόμενο στο διαδίκτυο, χρησιμοποιούμε μόνο πληροφορίες που είναι ελεύθερα και ανοιχτά προσβάσιμες στο διαδίκτυο. Αυτό μπορεί να περιλαμβάνει δημόσια διαθέσιμες ιστοσελίδες, δημόσια φόρουμ, δημόσια ιστολόγια, δημόσιες αναρτήσεις και άλλο δημόσια διαθέσιμο διαδικτυακό περιεχόμενο. Για παράδειγμα, αν συμμετέχετε σε ένα δημόσια διαθέσιμο διαδικτυακό φόρουμ συζητήσεων ή δημοσιεύετε ένα δημόσιο ιστολόγιο ή άλλη ανάρτηση, ενδέχεται να χρησιμοποιήσουμε αυτό το δημόσια προσβάσιμο περιεχόμενο για σκοπούς εκπαίδευσης μοντέλων. Ωστόσο, λαμβάνουμε μέτρα για να μειώνουμε την επεξεργασία προσωπικών πληροφοριών στη διαδικασία εκπαίδευσης.  Κατά τη συλλογή δημόσια διαθέσιμου διαδικτυακού περιεχομένου, δεν συλλέγουμε σκόπιμα δεδομένα από πηγές που είναι γνωστό ότι βρίσκονται πίσω από paywall ή από το σκοτεινό διαδίκτυο. Επιπλέον, εφαρμόζουμε φίλτρα για να αφαιρούμε υλικό από το οποίο δεν θέλουμε να μαθαίνουν τα μοντέλα μας, όπως ρητορική μίσους, περιεχόμενο για ενηλίκους, ιστότοπους που συγκεντρώνουν προσωπικές πληροφορίες και ανεπιθύμητη αλληλογραφία. Οι πληροφορίες που απομένουν χρησιμοποιούνται στη συνέχεια για την εκπαίδευση των μοντέλων μας. 

Οι ιδιοκτήτες ιστότοπων μπορούν να διαχειρίζονται αν δημόσια διαθέσιμο περιεχόμενο από τους ιστότοπούς τους μπορεί να προσπελαστεί για χρήση στην εκπαίδευση, χρησιμοποιώντας τυπικούς ελέγχους ιστού, όπως το robots.txt, για να απαγορεύσουν το GPTBot, το οποίο μπορεί να ανιχνεύει δημόσια διαθέσιμο περιεχόμενο ώστε να βοηθά στην εκπαίδευση των μοντέλων μας. Παρέχουμε καθοδήγηση για να βοηθήσουμε τους ιδιοκτήτες ιστότοπων να διαχειρίζονται τον τρόπο με τον οποίο οι ιστότοποι και το περιεχόμενό τους αλληλεπιδρούν με τα συστήματα τεχνητής νοημοσύνης μας. 

Χρησιμοποιούμε επίσης πληροφορίες από τρίτους συνεργάτες για να βοηθήσουμε στην εκπαίδευση και τη βελτίωση των μοντέλων μας. Αυτό μπορεί να περιλαμβάνει πληροφορίες σε σύνολα δεδομένων στα οποία αποκτούμε πρόσβαση μέσω συμφωνιών με τρίτους, καθώς και πληροφορίες που παρέχονται ή δημιουργούνται από ανθρώπινους εκπαιδευτές και ερευνητές, όπου επιτρέπεται βάσει των πολιτικών και των συμφωνιών μας. Αυτό συμβάλλει στη βελτίωση της ποιότητας, της ασφάλειας και της απόδοσης των μοντέλων μας. Αυτές οι πηγές μπορεί να περιλαμβάνουν κείμενο, εικόνες, ήχο, βίντεο ή άλλους τύπους δεδομένων, ανάλογα με το σύνολο δεδομένων.

Χρησιμοποιούμε επίσης όλο και περισσότερο συνθετικά δεδομένα σε ορισμένες διαδικασίες εκπαίδευσης. Για παράδειγμα, ενδέχεται να χρησιμοποιούμε πληροφορίες και τα μοντέλα μας για να δημιουργούμε συνθετικές προτροπές, πολυγλωσσικά παραδείγματα ή άλλο εκπαιδευτικό υλικό. Τα συνθετικά δεδομένα μπορούν να συμβάλουν στη βελτίωση της απόδοσης των μοντέλων, μεταξύ άλλων συμπληρώνοντας δεδομένα εκπαίδευσης σε τομείς όπου τα δεδομένα είναι περιορισμένα ή μη ισορροπημένα, και μπορούν επίσης να υποστηρίξουν προσεγγίσεις ανάπτυξης μοντέλων που ενισχύουν το απόρρητο.

Χρησιμοποιούνται προσωπικές πληροφορίες για την εκπαίδευση του ChatGPT;

Ένα σημαντικό μέρος του διαδικτυακού περιεχομένου αφορά πληροφορίες για ανθρώπους, επομένως τα δεδομένα εκπαίδευσής μας μπορεί παρεμπιπτόντως να περιλαμβάνουν προσωπικές πληροφορίες. Ωστόσο, λαμβάνουμε μέτρα για να μειώνουμε την επεξεργασία προσωπικών πληροφοριών στη διαδικασία εκπαίδευσης.

Χρησιμοποιούμε δεδομένα εκπαίδευσης για να αναπτύσσουμε τις δυνατότητες του μοντέλου—όπως η πρόβλεψη, η συλλογιστική και η επίλυση προβλημάτων—και όχι για να δημιουργούμε προφίλ ατόμων, να επικοινωνούμε μαζί τους ή να εξατομικεύουμε διαφημίσεις για αυτά.

Σε ορισμένες περιπτώσεις, τα μοντέλα μπορεί να μαθαίνουν από προσωπικές πληροφορίες για να κατανοούν πώς λειτουργούν στη γλώσσα στοιχεία όπως ονόματα και διευθύνσεις ή για να αναγνωρίζουν δημόσια πρόσωπα και γνωστές οντότητες. Αυτό βοηθά το μοντέλο να δημιουργεί πιο ακριβείς και κατάλληλες για το συγκείμενο απαντήσεις.

Πώς προστατεύονται οι προσωπικές πληροφορίες κατά την εκπαίδευση;

Λαμβάνουμε ενεργά μέτρα για να περιορίζουμε την επεξεργασία προσωπικών πληροφοριών κατά την εκπαίδευση. Για παράδειγμα, εξαιρούμε γνωστές πηγές που συγκεντρώνουν μεγάλες ποσότητες προσωπικών δεδομένων, εφαρμόζουμε φιλτράρισμα για τη μείωση των προσωπικών πληροφοριών στη διαδικασία εκπαίδευσης και λαμβάνουμε μέτρα για τον εντοπισμό και την αφαίρεση διπλότυπου περιεχομένου, ώστε να μειώνεται ο κίνδυνος επανάληψης δεδομένων εκπαίδευσης. Επιπλέον, εκπαιδεύουμε τα μοντέλα μας ώστε να αποφεύγουν να απαντούν σε αιτήματα για ιδιωτικές ή ευαίσθητες πληροφορίες σχετικά με άτομα. 

Για πόσο καιρό διατηρούμε πληροφορίες

Διατηρούμε πληροφορίες στα δεδομένα εκπαίδευσης μόνο για όσο διάστημα είναι εύλογα απαραίτητο για τους σκοπούς που περιγράφονται σε αυτό το άρθρο και στην πολιτική απορρήτου μας, μεταξύ άλλων για την ανάπτυξη και τη βελτίωση των μοντέλων μας και για συναφείς σκοπούς επιστημονικής έρευνας. Η διατήρηση υπόκειται σε περιοδικό έλεγχο για να διασφαλίζεται ότι παραμένει αναγκαία και διαφέρει ανάλογα με τον τύπο των πληροφοριών και τον τρόπο χρήσης τους. Κατά τον καθορισμό της διατήρησης, λαμβάνουμε υπόψη παράγοντες όπως ο σκοπός μας για την επεξεργασία των πληροφοριών, η ποσότητα, η φύση και η ευαισθησία των πληροφοριών, ο πιθανός κίνδυνος βλάβης από μη εξουσιοδοτημένη χρήση ή κοινοποίηση, καθώς και τυχόν νομικές υποχρεώσεις στις οποίες υπαγόμαστε.

Πώς συμμορφώνεται η ανάπτυξη του ChatGPT με τη νομοθεσία περί απορρήτου;

Χρησιμοποιούμε τις πληροφορίες εκπαίδευσης με νόμιμο τρόπο. Τα θεμελιώδη μοντέλα μας τροφοδοτούν ένα ευρύ φάσμα ωφέλιμων εφαρμογών—όπως εργαλεία προσβασιμότητας, υποστήριξη πελατών, ανάπτυξη λογισμικού, εξατομικευμένη εκπαίδευση και επιστημονική έρευνα. Αυτές οι δυνατότητες εξαρτώνται από δεδομένα εκπαίδευσης μεγάλης κλίμακας, συμπεριλαμβανομένων δημόσια διαθέσιμων πληροφοριών και πληροφοριών από τρίτους συνεργάτες. Εφαρμόζουμε μέτρα προστασίας σε όλη τη διαδικασία εκπαίδευσης, συμπεριλαμβανομένων μέτρων που έχουν σχεδιαστεί για να μειώνουν την επεξεργασία προσωπικών πληροφοριών στη διαδικασία εκπαίδευσης και να μετριάζουν κινδύνους, όπως περιγράφεται σε αυτό το άρθρο. Βασίζουμε τη συλλογή και χρήση προσωπικών πληροφοριών που περιλαμβάνονται στις πληροφορίες εκπαίδευσης σε έννομα συμφέροντα σύμφωνα με τη νομοθεσία περί απορρήτου, όπως ο ΓΚΠΔ, μεταξύ άλλων για την εκπαίδευση και τη βελτίωση των μοντέλων μας προς όφελος των χρηστών και της ευρύτερης κοινωνίας, σύμφωνα με την αποστολή μας να διασφαλίσουμε ότι η τεχνητή γενική νοημοσύνη ωφελεί τους πάντες, όπως εξηγείται πιο αναλυτικά στην πολιτική απορρήτου μας. Έχουμε ολοκληρώσει εκτίμηση αντικτύπου σχετικά με την προστασία δεδομένων, ώστε να συμβάλουμε στη διασφάλιση ότι συλλέγουμε και χρησιμοποιούμε αυτές τις πληροφορίες νόμιμα και υπεύθυνα.

Πότε μπορεί να κοινοποιούνται ή να μεταβιβάζονται πληροφορίες

Δεν «πουλάμε» προσωπικές πληροφορίες και κοινοποιούμε προσωπικές πληροφορίες σε δεδομένα εκπαίδευσης μόνο στις περιορισμένες περιπτώσεις που περιγράφονται στην πολιτική απορρήτου μας. Για παράδειγμα, ενδέχεται να κοινοποιούμε πληροφορίες σε συνδεδεμένες εταιρείες, προμηθευτές και παρόχους υπηρεσιών που υποστηρίζουν την ανάπτυξη, τη δοκιμή και τη βελτίωση των μοντέλων μας. Ενδέχεται επίσης να κοινοποιούμε πληροφορίες όταν πιστεύουμε καλόπιστα ότι η ενέργεια αυτή είναι απαραίτητη για τη συμμόρφωση με νομική υποχρέωση ή για την προστασία των δικαιωμάτων, της ασφάλειας και της προστασίας μας, καθώς και των χρηστών, των εργαζομένων ή του κοινού, όπως περιγράφεται στην πολιτική απορρήτου μας.

Καθώς η υποδομή μας είναι παγκόσμια, οι προσωπικές πληροφορίες στα δεδομένα εκπαίδευσης ενδέχεται να υποβάλλονται σε επεξεργασία σε χώρες εκτός του ΕΟΧ, της Ελβετίας ή του Ηνωμένου Βασιλείου (συμπεριλαμβανομένων των Ηνωμένων Πολιτειών). Όπου συμβαίνει αυτό, εφαρμόζουμε κατάλληλες διασφαλίσεις, όπως αποφάσεις επάρκειας ή τυποποιημένες συμβατικές ρήτρες, όπως περιγράφεται στην πολιτική απορρήτου μας.

Τα δικαιώματά σας και πώς να τα ασκήσετε

Απαντούμε σε αιτήματα εναντίωσης και σε παρόμοια αιτήματα άσκησης δικαιωμάτων. Ως αποτέλεσμα της εκμάθησης της γλώσσας, οι απαντήσεις του ChatGPT μπορεί μερικές φορές να περιλαμβάνουν προσωπικές πληροφορίες για άτομα των οποίων οι προσωπικές πληροφορίες εμφανίζονται πολλές φορές στο δημόσιο διαδίκτυο (για παράδειγμα, δημόσια πρόσωπα). Άτομα σε ορισμένες δικαιοδοσίες μπορούν να εναντιωθούν στην επεξεργασία των προσωπικών τους πληροφοριών από τα μοντέλα μας ή να υποβάλουν άλλα αιτήματα άσκησης δικαιωμάτων υποκειμένου των δεδομένων μέσω της Πύλης Απορρήτου μας. Μπορείτε επίσης να ασκήσετε αυτά τα δικαιώματα επικοινωνώντας στη διεύθυνση privacy@openai.com

Για να μας βοηθήσετε να αξιολογήσουμε και να απαντήσουμε στο αίτημά σας, παράσχετε επαρκείς πληροφορίες ώστε να κατανοήσουμε σε ποιες προσωπικές πληροφορίες αφορά το αίτημά σας, όπως το όνομά σας, σχετικά URL, συγκεκριμένα παραδείγματα εξόδων μοντέλου ή άλλες λεπτομέρειες που βοηθούν στον εντοπισμό του ζητήματος. Σε ορισμένες περιπτώσεις, ενδέχεται να σας ζητήσουμε να επαληθεύσετε την ταυτότητά σας ή να επιβεβαιώσετε ότι οι πληροφορίες αφορούν εσάς πριν μπορέσουμε να προβούμε σε ενέργειες. Περισσότερες πληροφορίες σχετικά με τον τρόπο υποβολής αυτών των αιτημάτων, συμπεριλαμβανομένων βέλτιστων πρακτικών και του τρόπου εξέτασης των αιτημάτων, είναι διαθέσιμες στο άρθρο του Κέντρου Βοήθειας μας σχετικά με την αφαίρεση προσωπικών δεδομένων από το ChatGPT. Εξετάζουμε τα αιτήματα σύμφωνα με την ισχύουσα νομοθεσία περί απορρήτου και απαντούμε εντός των ισχύοντων νόμιμων προθεσμιών.

Λάβετε υπόψη ότι, σύμφωνα με τη νομοθεσία περί απορρήτου, ορισμένα δικαιώματα μπορεί να μην είναι απόλυτα. Για παράδειγμα, ενδέχεται να μην μπορούμε να ικανοποιήσουμε ένα αίτημα όταν δεν μπορούμε να επαληθεύσουμε τις σχετικές πληροφορίες, όταν το αίτημα δεν αφορά προσωπικές πληροφορίες που επεξεργάζεται η OpenAI, όταν ισχύει κάποια εξαίρεση ή όταν έχουμε άλλο νόμιμο λόγο να το πράξουμε. Τα αιτήματα αξιολογούνται κατά περίπτωση και μπορεί να συνεπάγονται στάθμιση των δικαιωμάτων απορρήτου έναντι άλλων σημαντικών παραμέτρων, όπως η ελευθερία της έκφρασης και το δημόσιο συμφέρον. 

Ωστόσο, προσπαθούμε να δίνουμε προτεραιότητα στην προστασία των προσωπικών πληροφοριών και συμμορφωνόμαστε με όλους τους ισχύοντες νόμους περί απορρήτου. Αν θεωρείτε ότι δεν αντιμετωπίσαμε επαρκώς κάποιο ζήτημα, έχετε το δικαίωμα να υποβάλετε καταγγελία στην τοπική εποπτική αρχή σας.

Για περισσότερες πληροφορίες σχετικά με τις πρακτικές της OpenAI όσον αφορά τις προσωπικές πληροφορίες που συλλέγουμε από εσάς ή για εσάς όταν χρησιμοποιείτε τον ιστότοπο, τις εφαρμογές και τις υπηρεσίες μας, ανατρέξτε στην πολιτική απορρήτου μας.

Σας βοήθησε αυτό το άρθρο;