OpenAI
Αυτή η σελίδα μεταφράστηκε αυτόματα. Δείτε το πρωτότυπο άρθρο στα αγγλικά.

Πώς αναπτύσσονται το ChatGPT και τα βασικά μας μοντέλα

Μάθετε περισσότερα για το πώς αναπτύσσουμε τα μοντέλα μας και τα εφαρμόζουμε σε προϊόντα όπως το ChatGPT

Τελευταία ενημέρωση: 7 days ago

Τα βασικά μοντέλα της OpenAI, συμπεριλαμβανομένων εκείνων που υποστηρίζουν το ChatGPT, αναπτύσσονται με τη χρήση τριών κύριων πηγών πληροφοριών: (1) πληροφορίες που είναι δημόσια διαθέσιμες στο διαδίκτυο, (2) πληροφορίες στις οποίες αποκτούμε πρόσβαση σε συνεργασία με τρίτους και (3) πληροφορίες που παρέχουν ή δημιουργούν οι χρήστες, οι εκπαιδευτές και οι ερευνητές μας.

Η ανάπτυξη βασικών μοντέλων όπως αυτά που χρησιμοποιούνται στο ChatGPT περιλαμβάνει διάφορα στάδια, όπως την προετοιμασία των δεδομένων εκπαίδευσης, την προεκπαίδευση και τη μετεκπαίδευση, καθώς και τη συνεχή αξιολόγηση και βελτίωση μετά την κυκλοφορία τους. Σε αυτά τα στάδια μπορεί να χρησιμοποιούνται διαφορετικοί τύποι πληροφοριών για διάφορους σκοπούς, όπως η βελτίωση της απόδοσης, της αξιοπιστίας και της ασφάλειας των μοντέλων. 

Αυτό το άρθρο παρουσιάζει συνοπτικά τις πληροφορίες που χρησιμοποιούμε για την ανάπτυξη αυτών των μοντέλων, τον τρόπο με τον οποίο τις συλλέγουμε και τις χρησιμοποιούμε σύμφωνα με τη νομοθεσία περί απορρήτου, καθώς και τις δικλίδες ασφαλείας που εφαρμόζουμε σε όλη τη διαδικασία εκπαίδευσης. Για να μάθετε πώς συλλέγουμε και χρησιμοποιούμε πληροφορίες από τους χρήστες των υπηρεσιών μας, καθώς και πώς μπορείτε να εξαιρέσετε τις συνομιλίες σας στο ChatGPT από τη χρήση για τη βελτίωση των μοντέλων μας, ανατρέξτε στην Πολιτική Απορρήτου και σε αυτό το άρθρο του Κέντρου Βοήθειας.

Τι είναι το ChatGPT και πώς λειτουργεί;

Το ChatGPT είναι μια υπηρεσία που βασίζεται στην τεχνητή νοημοσύνη και είναι προσβάσιμη μέσω διαδικτύου ή εφαρμογής. Μπορείτε να χρησιμοποιήσετε το ChatGPT για πολλές εργασίες, όπως οργάνωση και σύνοψη πληροφοριών, υποστήριξη στις μεταφράσεις, βοήθεια στον προγραμματισμό, την έρευνα και την ανάλυση, ολοκλήρωση εργασιών πολλών βημάτων σε διάφορα εργαλεία, ανάλυση ή δημιουργία εικόνων, άντληση δημιουργικής έμπνευσης και ιδεών, καθώς και άλλες καθημερινές δραστηριότητες. Το ChatGPT έχει σχεδιαστεί ώστε να κατανοεί και να απαντά στις ερωτήσεις και τις οδηγίες των χρηστών, μαθαίνοντας μοτίβα από μεγάλες ποσότητες πληροφοριών, όπως κείμενο, εικόνες, ήχο και βίντεο. 

Κατά την εκπαίδευση, το μοντέλο αναλύει τις σχέσεις μέσα σε αυτά τα δεδομένα —όπως το πώς εμφανίζονται συνήθως μαζί οι λέξεις σε ένα συγκεκριμένο πλαίσιο— και χρησιμοποιεί αυτή την κατανόηση για να προβλέπει, λέξη προς λέξη, την πιθανότερη επόμενη λέξη κατά τη δημιουργία μιας απάντησης. Το κείμενο μπορεί να μετατραπεί σε μικρότερες μονάδες, οι οποίες ορισμένες φορές ονομάζονται «διακριτικά» και μπορεί να αντιπροσωπεύουν ολόκληρες λέξεις, μέρη λέξεων ή σημεία στίξης. Τα διακριτικά είναι οι δομικές μονάδες του κειμένου που επεξεργάζεται το μοντέλο. Αντίστοιχα, τα μοντέλα που δημιουργούν άλλες μορφές περιεχομένου, όπως εικόνες, μαθαίνουν μοτίβα από τον τρόπο με τον οποίο τα pixel σχετίζονται μεταξύ τους και με τις αντίστοιχες λεζάντες στα δεδομένα εκπαίδευσης.

Για παράδειγμα, κατά τη διαδικασία μάθησης του μοντέλου (γνωστή ως «εκπαίδευση»), μπορεί να του ζητηθεί να συμπληρώσει μια πρόταση όπως: «Αντί να στρίψει αριστερά, έστριψε ___.» Στην αρχή της εκπαίδευσης, οι απαντήσεις του είναι σε μεγάλο βαθμό τυχαίες. Ωστόσο, καθώς το μοντέλο επεξεργάζεται και μαθαίνει από μεγάλο όγκο κειμένου, βελτιώνεται στην αναγνώριση μοτίβων και στην πρόβλεψη της πιθανότερης επόμενης λέξης. Αυτή η διαδικασία επαναλαμβάνεται σε εκατομμύρια προτάσεις, ώστε να βελτιωθούν η κατανόηση και η ακρίβειά του.

Επειδή υπάρχουν πολλές εύλογες συμπληρώσεις μιας πρότασης —όπως «Αντί να στρίψει αριστερά, έστριψε δεξιά», «γύρω» ή «πίσω»— ο τρόπος με τον οποίο απαντά το μοντέλο εμπεριέχει εγγενώς ένα στοιχείο τυχαιότητας. Κατά συνέπεια, η ίδια ερώτηση μπορεί να δώσει διαφορετικές απαντήσεις όταν υποβάλλεται ξανά.

Τα μοντέλα μηχανικής μάθησης αποτελούνται από μεγάλα σύνολα αριθμών, γνωστά ως «βάρη» ή «παράμετροι», καθώς και από κώδικα που ερμηνεύει και χρησιμοποιεί αυτούς τους αριθμούς. Αυτά τα μοντέλα δεν αποθηκεύουν ούτε διατηρούν αντίγραφα των δεδομένων στα οποία εκπαιδεύονται. Αντίθετα, καθώς ένα μοντέλο μαθαίνει, οι τιμές των παραμέτρων του προσαρμόζονται ελαφρώς ώστε να αποτυπώνουν τα μοτίβα που έχει εντοπίσει. Στο προηγούμενο παράδειγμα, το μοντέλο πέρασε από την πρόβλεψη τυχαίων λέξεων σε ακριβέστερες προβλέψεις, όχι αποθηκεύοντας τις προτάσεις εκπαίδευσης, αλλά ενημερώνοντας τις εσωτερικές παραμέτρους του. Το μοντέλο δεν διατηρεί αντίγραφα των προτάσεων, των εικόνων ή του ήχου που επεξεργάζεται κατά την εκπαίδευση. Το ChatGPT δεν κάνει «αντιγραφή και επικόλληση» από τα δεδομένα εκπαίδευσής του. Λειτουργεί όπως ένας εκπαιδευτικός που, έπειτα από εκτενή μελέτη, μπορεί να εξηγεί έννοιες κατανοώντας τις μεταξύ τους σχέσεις, χωρίς να απομνημονεύει ή να αναπαράγει αυτούσιο το αρχικό υλικό. Όταν δημιουργεί μια απάντηση σε αίτημα χρήστη, το μοντέλο χρησιμοποιεί αυτά τα βάρη που έχει μάθει για να προβλέψει και να δημιουργήσει νέο περιεχόμενο.

Τι είδους πληροφορίες χρησιμοποιούνται για την εκπαίδευση του ChatGPT;

Από το δημόσια διαθέσιμο περιεχόμενο του διαδικτύου χρησιμοποιούμε μόνο πληροφορίες που είναι ελεύθερα και ανοικτά προσβάσιμες στο διαδίκτυο. Σε αυτές μπορεί να περιλαμβάνονται δημόσια διαθέσιμες ιστοσελίδες, δημόσια φόρουμ, δημόσια ιστολόγια και αναρτήσεις, καθώς και άλλο δημόσια διαθέσιμο διαδικτυακό περιεχόμενο. Για παράδειγμα, αν συμμετέχετε σε ένα δημόσια διαθέσιμο διαδικτυακό φόρουμ συζητήσεων ή δημοσιεύετε ένα δημόσιο ιστολόγιο ή άλλη δημόσια ανάρτηση, ενδέχεται να χρησιμοποιήσουμε αυτό το δημόσια προσβάσιμο περιεχόμενο για την εκπαίδευση μοντέλων. Ωστόσο, λαμβάνουμε μέτρα για να περιορίζουμε την επεξεργασία προσωπικών πληροφοριών κατά τη διαδικασία εκπαίδευσης.  Όταν συλλέγουμε δημόσια διαθέσιμο περιεχόμενο από το διαδίκτυο, δεν συγκεντρώνουμε σκόπιμα δεδομένα από πηγές που γνωρίζουμε ότι βρίσκονται πίσω από συνδρομητικά τείχη ή από το σκοτεινό διαδίκτυο. Επιπλέον, εφαρμόζουμε φίλτρα για να αφαιρούμε υλικό από το οποίο δεν θέλουμε να μαθαίνουν τα μοντέλα μας, όπως ρητορική μίσους, περιεχόμενο για ενηλίκους, ιστότοποι που συγκεντρώνουν προσωπικές πληροφορίες και ανεπιθύμητο περιεχόμενο. Οι πληροφορίες που απομένουν χρησιμοποιούνται στη συνέχεια για την εκπαίδευση των μοντέλων μας. 

Οι ιδιοκτήτες ιστοτόπων μπορούν να διαχειρίζονται αν το δημόσια διαθέσιμο περιεχόμενο των ιστοτόπων τους θα είναι προσβάσιμο για χρήση στην εκπαίδευση, αξιοποιώντας τυπικά εργαλεία ελέγχου του ιστού, όπως το robots.txt, ώστε να αποκλείουν το GPTBot, το οποίο μπορεί να ανιχνεύει δημόσια διαθέσιμο περιεχόμενο για να συμβάλλει στην εκπαίδευση των μοντέλων μας. Παρέχουμε οδηγίες που βοηθούν τους ιδιοκτήτες ιστοτόπων να διαχειρίζονται τον τρόπο με τον οποίο οι ιστότοποι και το περιεχόμενό τους αλληλεπιδρούν με τα συστήματα τεχνητής νοημοσύνης μας. 

Χρησιμοποιούμε επίσης πληροφορίες από τρίτους συνεργάτες για να συμβάλλουμε στην εκπαίδευση και τη βελτίωση των μοντέλων μας. Σε αυτές μπορεί να περιλαμβάνονται πληροφορίες από σύνολα δεδομένων στα οποία αποκτούμε πρόσβαση μέσω συμφωνιών με τρίτους, καθώς και πληροφορίες που παρέχονται ή δημιουργούνται από εκπαιδευτές και ερευνητές, όπου αυτό επιτρέπεται από τις πολιτικές και τις συμφωνίες μας. Αυτό συμβάλλει στη βελτίωση της ποιότητας, της ασφάλειας και της απόδοσης των μοντέλων μας. Ανάλογα με το σύνολο δεδομένων, αυτές οι πηγές μπορεί να περιλαμβάνουν κείμενο, εικόνες, ήχο, βίντεο ή άλλους τύπους δεδομένων.

Χρησιμοποιούμε επίσης όλο και περισσότερο συνθετικά δεδομένα σε ορισμένες διαδικασίες εκπαίδευσης. Για παράδειγμα, μπορεί να χρησιμοποιούμε πληροφορίες και τα μοντέλα μας για να δημιουργούμε συνθετικές προτροπές, πολυγλωσσικά παραδείγματα ή άλλο εκπαιδευτικό υλικό. Τα συνθετικά δεδομένα μπορούν να συμβάλουν στη βελτίωση της απόδοσης των μοντέλων, μεταξύ άλλων συμπληρώνοντας τα δεδομένα εκπαίδευσης σε τομείς όπου είναι περιορισμένα ή μη ισορροπημένα, και μπορούν επίσης να υποστηρίξουν προσεγγίσεις ανάπτυξης μοντέλων που ενισχύουν την προστασία του απορρήτου.

Χρησιμοποιούνται προσωπικές πληροφορίες για την εκπαίδευση του ChatGPT;

Σημαντικό μέρος του διαδικτυακού περιεχομένου αφορά πληροφορίες για ανθρώπους, επομένως τα δεδομένα εκπαίδευσής μας ενδέχεται να περιλαμβάνουν παρεμπιπτόντως προσωπικές πληροφορίες. Ωστόσο, λαμβάνουμε μέτρα για να περιορίζουμε την επεξεργασία προσωπικών πληροφοριών κατά τη διαδικασία εκπαίδευσης.

Χρησιμοποιούμε δεδομένα εκπαίδευσης για να αναπτύσσουμε τις δυνατότητες του μοντέλου —όπως η πρόβλεψη, η συλλογιστική και η επίλυση προβλημάτων— και όχι για να δημιουργούμε προφίλ ατόμων, να επικοινωνούμε μαζί τους ή να εξατομικεύουμε διαφημίσεις για αυτά.

Σε ορισμένες περιπτώσεις, τα μοντέλα μπορεί να μαθαίνουν από προσωπικές πληροφορίες, ώστε να κατανοούν πώς λειτουργούν στη γλώσσα στοιχεία όπως τα ονόματα και οι διευθύνσεις ή να αναγνωρίζουν δημόσια πρόσωπα και ευρέως γνωστές οντότητες. Αυτό βοηθά το μοντέλο να δημιουργεί ακριβέστερες απαντήσεις, κατάλληλες για το εκάστοτε πλαίσιο.

Πώς προστατεύονται οι προσωπικές πληροφορίες κατά την εκπαίδευση;

Λαμβάνουμε ενεργά μέτρα για να περιορίζουμε την επεξεργασία προσωπικών πληροφοριών κατά την εκπαίδευση. Για παράδειγμα, αποκλείουμε γνωστές πηγές που συγκεντρώνουν μεγάλες ποσότητες προσωπικών δεδομένων, εφαρμόζουμε φίλτρα για να περιορίζουμε τις προσωπικές πληροφορίες στη διαδικασία εκπαίδευσης και λαμβάνουμε μέτρα για τον εντοπισμό και την αφαίρεση διπλότυπου περιεχομένου, ώστε να μειώνεται ο κίνδυνος επανάληψης δεδομένων εκπαίδευσης. Επιπλέον, εκπαιδεύουμε τα μοντέλα μας ώστε να αποφεύγουν να απαντούν σε αιτήματα για ιδιωτικές ή ευαίσθητες πληροφορίες σχετικά με άτομα. 

Για πόσο διάστημα διατηρούμε τις πληροφορίες

Διατηρούμε πληροφορίες στα δεδομένα εκπαίδευσης μόνο για όσο διάστημα είναι εύλογα αναγκαίο για τους σκοπούς που περιγράφονται σε αυτό το άρθρο και στην Πολιτική Απορρήτου, μεταξύ άλλων για την ανάπτυξη και τη βελτίωση των μοντέλων μας και για συναφείς σκοπούς επιστημονικής έρευνας. Η διατήρηση επανεξετάζεται περιοδικά ώστε να επιβεβαιώνεται ότι εξακολουθεί να είναι αναγκαία και διαφέρει ανάλογα με τον τύπο των πληροφοριών και τον τρόπο χρήσης τους. Κατά τον καθορισμό της περιόδου διατήρησης, λαμβάνουμε υπόψη παράγοντες όπως ο σκοπός επεξεργασίας των πληροφοριών, η ποσότητα, η φύση και η ευαισθησία τους, ο πιθανός κίνδυνος βλάβης από μη εξουσιοδοτημένη χρήση ή γνωστοποίηση και τυχόν νομικές υποχρεώσεις που υπέχουμε.

Πώς συμμορφώνεται η ανάπτυξη του ChatGPT με τη νομοθεσία περί απορρήτου;

Χρησιμοποιούμε τις πληροφορίες εκπαίδευσης με νόμιμο τρόπο. Τα βασικά μοντέλα μας υποστηρίζουν ένα ευρύ φάσμα ωφέλιμων εφαρμογών, όπως εργαλεία προσβασιμότητας, υποστήριξη πελατών, ανάπτυξη λογισμικού, εξατομικευμένη εκπαίδευση και επιστημονική έρευνα. Αυτές οι δυνατότητες εξαρτώνται από δεδομένα εκπαίδευσης μεγάλης κλίμακας, συμπεριλαμβανομένων δημόσια διαθέσιμων πληροφοριών και πληροφοριών από τρίτους συνεργάτες. Εφαρμόζουμε δικλίδες ασφαλείας σε όλη τη διαδικασία εκπαίδευσης, συμπεριλαμβανομένων μέτρων που αποσκοπούν στον περιορισμό της επεξεργασίας προσωπικών πληροφοριών κατά την εκπαίδευση και στον μετριασμό των κινδύνων, όπως περιγράφεται σε αυτό το άρθρο. Βασίζουμε τη συλλογή και τη χρήση προσωπικών πληροφοριών που περιλαμβάνονται στις πληροφορίες εκπαίδευσης σε έννομα συμφέροντα, σύμφωνα με τη νομοθεσία περί απορρήτου, όπως ο ΓΚΠΔ. Σε αυτά περιλαμβάνεται η εκπαίδευση και η βελτίωση των μοντέλων μας προς όφελος των χρηστών και της ευρύτερης κοινωνίας, σύμφωνα με την αποστολή μας να διασφαλίσουμε ότι η τεχνητή γενική νοημοσύνη ωφελεί όλους, όπως εξηγείται αναλυτικότερα στην Πολιτική Απορρήτου. Έχουμε ολοκληρώσει εκτίμηση αντικτύπου σχετικά με την προστασία δεδομένων, ώστε να συμβάλουμε στη διασφάλιση ότι συλλέγουμε και χρησιμοποιούμε αυτές τις πληροφορίες νόμιμα και υπεύθυνα.

Πότε ενδέχεται να κοινοποιούνται ή να διαβιβάζονται πληροφορίες

Δεν «πουλάμε» προσωπικές πληροφορίες και γνωστοποιούμε προσωπικές πληροφορίες που περιέχονται στα δεδομένα εκπαίδευσης μόνο στις περιορισμένες περιπτώσεις που περιγράφονται στην Πολιτική Απορρήτου μας. Για παράδειγμα, ενδέχεται να κοινοποιούμε πληροφορίες σε συνδεδεμένες εταιρείες, προμηθευτές και παρόχους υπηρεσιών που υποστηρίζουν την ανάπτυξη, τη δοκιμή και τη βελτίωση των μοντέλων μας. Μπορεί επίσης να γνωστοποιούμε πληροφορίες όταν πιστεύουμε καλόπιστα ότι αυτό είναι αναγκαίο για τη συμμόρφωση με μια νομική υποχρέωση ή για την προστασία των δικαιωμάτων και της ασφάλειας τόσο των δικών μας όσο και των χρηστών, των εργαζομένων ή του κοινού, όπως περιγράφεται στην Πολιτική Απορρήτου.

Επειδή οι υποδομές μας είναι παγκόσμιες, οι προσωπικές πληροφορίες στα δεδομένα εκπαίδευσης ενδέχεται να υποβάλλονται σε επεξεργασία σε χώρες εκτός του ΕΟΧ, της Ελβετίας ή του Ηνωμένου Βασιλείου (συμπεριλαμβανομένων των Ηνωμένων Πολιτειών). Όπου συμβαίνει αυτό, εφαρμόζουμε κατάλληλες δικλίδες ασφαλείας, όπως αποφάσεις επάρκειας ή τυποποιημένες συμβατικές ρήτρες, όπως περιγράφεται στην Πολιτική Απορρήτου.

Τα δικαιώματά σας και πώς να τα ασκήσετε

Απαντάμε σε αιτήματα εναντίωσης και σε παρόμοια αιτήματα άσκησης δικαιωμάτων. Ως αποτέλεσμα της εκμάθησης της γλώσσας, οι απαντήσεις του ChatGPT ενδέχεται ορισμένες φορές να περιλαμβάνουν προσωπικές πληροφορίες για άτομα των οποίων τα στοιχεία εμφανίζονται πολλές φορές στο δημόσιο διαδίκτυο (για παράδειγμα, δημόσια πρόσωπα). Άτομα σε ορισμένες δικαιοδοσίες μπορούν να αντιταχθούν στην επεξεργασία των προσωπικών πληροφοριών τους από τα μοντέλα μας ή να υποβάλουν άλλα αιτήματα άσκησης δικαιωμάτων υποκειμένων των δεδομένων μέσω της Πύλης Απορρήτου. Μπορείτε επίσης να ασκήσετε αυτά τα δικαιώματα επικοινωνώντας στη διεύθυνση privacy@openai.com.

Για να μας βοηθήσετε να αξιολογήσουμε και να απαντήσουμε στο αίτημά σας, παρακαλούμε να παρέχετε αρκετές πληροφορίες ώστε να κατανοήσουμε ποιες προσωπικές πληροφορίες αφορά, όπως το όνομά σας, σχετικές διευθύνσεις URL, συγκεκριμένα παραδείγματα αποτελεσμάτων μοντέλου ή άλλα στοιχεία που βοηθούν στον εντοπισμό του ζητήματος. Σε ορισμένες περιπτώσεις, μπορεί να σας ζητήσουμε να επαληθεύσετε την ταυτότητά σας ή να επιβεβαιώσετε ότι οι πληροφορίες σας αφορούν, προτού μπορέσουμε να ενεργήσουμε. Περισσότερες πληροφορίες σχετικά με την υποβολή αυτών των αιτημάτων, συμπεριλαμβανομένων των βέλτιστων πρακτικών και του τρόπου εξέτασής τους, διατίθενται στο άρθρο του Κέντρου Βοήθειας σχετικά με την αφαίρεση προσωπικών δεδομένων από το ChatGPT. Εξετάζουμε τα αιτήματα σύμφωνα με την ισχύουσα νομοθεσία περί απορρήτου και απαντάμε εντός των προβλεπόμενων νόμιμων προθεσμιών.

Λάβετε υπόψη ότι, σύμφωνα με τη νομοθεσία περί απορρήτου, ορισμένα δικαιώματα ενδέχεται να μην είναι απόλυτα. Για παράδειγμα, ενδέχεται να μην μπορούμε να ικανοποιήσουμε ένα αίτημα αν δεν μπορούμε να επαληθεύσουμε τις σχετικές πληροφορίες, αν το αίτημα δεν αφορά προσωπικές πληροφορίες που επεξεργάζεται η OpenAI, αν ισχύει κάποια εξαίρεση ή αν υπάρχει άλλος νόμιμος λόγος για να μην το πράξουμε. Τα αιτήματα αξιολογούνται κατά περίπτωση και ενδέχεται να απαιτούν στάθμιση των δικαιωμάτων απορρήτου έναντι άλλων σημαντικών παραμέτρων, όπως η ελευθερία της έκφρασης και το δημόσιο συμφέρον.

Ωστόσο, προσπαθούμε να δίνουμε προτεραιότητα στην προστασία των προσωπικών πληροφοριών και να συμμορφωνόμαστε με όλη την ισχύουσα νομοθεσία περί απορρήτου. Αν θεωρείτε ότι δεν έχουμε αντιμετωπίσει επαρκώς κάποιο ζήτημα, έχετε το δικαίωμα να υποβάλετε καταγγελία στην τοπική εποπτική αρχή σας.

Για περισσότερες πληροφορίες σχετικά με τις πρακτικές της OpenAI όσον αφορά τις προσωπικές πληροφορίες που συλλέγουμε από ή σχετικά με εσάς όταν χρησιμοποιείτε τον ιστότοπο, τις εφαρμογές και τις υπηρεσίες μας, ανατρέξτε στην Πολιτική Απορρήτου.

Σας βοήθησε αυτό το άρθρο;