OpenAI
ეს გვერდი მანქანური თარგმანის მეშვეობით ითარგმნა. სტატიის ინგლისური დედნის ნახვა.

როგორ ვითარდება ChatGPT და ჩვენი საბაზისო მოდელები

გაიგეთ მეტი, როგორ ვავითარებთ ჩვენს მოდელებს და ვიყენებთ მათ ChatGPT-ის მსგავს პროდუქტებში

განახლებულია: 8 days ago

OpenAI-ის საბაზისო მოდელები, მათ შორის მოდელები, რომლებზეც ChatGPT მუშაობს, ინფორმაციის სამი ძირითადი წყაროს გამოყენებით იქმნება: (1) ინტერნეტში საჯაროდ ხელმისაწვდომი ინფორმაცია, (2) ინფორმაცია, რომელზე წვდომასაც მესამე მხარეებთან პარტნიორობით ვიღებთ, და (3) ინფორმაცია, რომელსაც ჩვენი მომხმარებლები, ადამიან-ტრენერები და მკვლევრები გვაწვდიან ან ქმნიან.

ChatGPT-ში გამოყენებულის მსგავსი საბაზისო მოდელების შექმნა რამდენიმე ეტაპს მოიცავს, მათ შორის სასწავლო მონაცემების მომზადებას, წინასწარ სწავლებასა და შემდგომ სწავლებას, ასევე გაშვების შემდეგ უწყვეტ შეფასებასა და გაუმჯობესებას. ამ ეტაპებზე სხვადასხვა ტიპის ინფორმაცია შეიძლება სხვადასხვა მიზნისთვის გამოვიყენოთ, მათ შორის მოდელის მუშაობის ხარისხის, სანდოობისა და უსაფრთხოების გასაუმჯობესებლად. 

ამ სტატიაში მიმოხილულია ინფორმაცია, რომელსაც ამ მოდელების შექმნის ხელშესაწყობად ვიყენებთ, როგორ ვაგროვებთ და ვიყენებთ ამ ინფორმაციას კონფიდენციალურობის კანონების დაცვით და რა დამცავ ზომებს ვიყენებთ სწავლების მთელი პროცესის განმავლობაში. იმის გასაგებად, როგორ ვაგროვებთ და ვიყენებთ ჩვენი სერვისების მომხმარებლების ინფორმაციას, მათ შორის როგორ თქვათ უარი ChatGPT-ის საუბრების გამოყენებაზე ჩვენი მოდელების გაუმჯობესების ხელშესაწყობად, იხილეთ ჩვენი კონფიდენციალურობის წესები და დახმარების ცენტრის ეს სტატია.

რა არის ChatGPT და როგორ მუშაობს?

ChatGPT არის ხელოვნურ ინტელექტზე დაფუძნებული სერვისი, რომელზეც წვდომა ინტერნეტით ან აპით შეგიძლიათ. ChatGPT შეგიძლიათ გამოიყენოთ მრავალი ამოცანისთვის, მათ შორის ინფორმაციის ორგანიზებისა და შეჯამებისთვის, თარგმანებში დახმარებისთვის, კოდირების, კვლევისა და ანალიზის მხარდასაჭერად, ხელსაწყოებში მრავალეტაპიანი ამოცანების შესასრულებლად, სურათების გასაანალიზებლად ან შესაქმნელად, კრეატიულობისა და იდეების შთაგონებისთვის და სხვა ყოველდღიური საქმიანობებისთვის. ChatGPT შექმნილია იმისთვის, რომ გაიგოს და უპასუხოს მომხმარებლის კითხვებსა და ინსტრუქციებს დიდი მოცულობის ინფორმაციიდან, მათ შორის ტექსტიდან, სურათებიდან, აუდიოდან და ვიდეოდან, კანონზომიერებების სწავლით. 

სწავლებისას მოდელი აანალიზებს ამ მონაცემებში არსებულ კავშირებს — მაგალითად, როგორ ჩნდება სიტყვები ჩვეულებრივ ერთად კონტექსტში — და ამ გაგებას იყენებს პასუხის შექმნისას შემდეგი ყველაზე სავარაუდო სიტყვის პროგნოზირებისთვის, თითო სიტყვით. ტექსტი შეიძლება გარდაიქმნას უფრო მცირე ერთეულებად, რომლებსაც ზოგჯერ „ტოკენებს“ უწოდებენ და რომლებიც შეიძლება წარმოადგენდეს მთელ სიტყვებს, სიტყვების ნაწილებს ან პუნქტუაციას. ტოკენები ტექსტის ის შემადგენელი ერთეულებია, რომლებსაც მოდელი ამუშავებს. ანალოგიურად, მოდელები, რომლებიც შიგთავსის სხვა ფორმებს, მაგალითად სურათებს, ქმნიან, სწავლობენ კანონზომიერებებს, თუ როგორ უკავშირდება პიქსელები ერთმანეთს და სასწავლო მონაცემებში არსებულ შესაბამის წარწერებს.

მაგალითად, მოდელის სწავლის პროცესში (რომელსაც „სწავლება“ ეწოდება) მოდელს შეიძლება დაევალოს ასეთი წინადადების დასრულება: „მარცხნივ მოხვევის ნაცვლად, ის ___ მოტრიალდა.“ სწავლების ადრეულ ეტაპზე მისი პასუხები მეტწილად შემთხვევითია. თუმცა, როცა მოდელი დიდი მოცულობის ტექსტს ამუშავებს და მისგან სწავლობს, ის უკეთ ამოიცნობს კანონზომიერებებს და უფრო ზუსტად პროგნოზირებს შემდეგ ყველაზე სავარაუდო სიტყვას. ეს პროცესი მილიონობით წინადადებაზე მეორდება, რათა მისი გაგება დაიხვეწოს და სიზუსტე გაუმჯობესდეს.

რადგან წინადადების დასრულების რამდენიმე დამაჯერებელი გზა არსებობს — მაგალითად, „მარცხნივ მოხვევის ნაცვლად, ის მარჯვნივ მოუხვია“, „შემობრუნდა“ ან „უკან დაბრუნდა“ — მოდელის პასუხებში შემთხვევითობის ბუნებრივი ელემენტია. შედეგად, ერთსა და იმავე კითხვაზე სხვადასხვა მოთხოვნისას შეიძლება განსხვავებული პასუხები მიიღოთ.

მანქანური სწავლების მოდელები შედგება რიცხვების დიდი ნაკრებებისგან, რომლებიც „წონების“ ან „პარამეტრების“ სახელითაა ცნობილი, და კოდისგან, რომელიც ამ რიცხვებს განმარტავს და იყენებს. ეს მოდელები არ ინახავს იმ მონაცემების ასლებს, რომლებზეც სწავლება გაიარა. ამის ნაცვლად, როცა მოდელი სწავლობს, მისი პარამეტრების მნიშვნელობები მცირედ იცვლება, რათა ასახოს გამოვლენილი კანონზომიერებები. ზემოთ მოყვანილ მაგალითში მოდელი შემთხვევითი სიტყვების პროგნოზირებიდან უფრო ზუსტ პროგნოზებამდე გაუმჯობესდა — არა სასწავლო წინადადებების შენახვით, არამედ შიდა პარამეტრების განახლებით. მოდელი არ ინახავს იმ წინადადებების, სურათების ან აუდიოს ასლებს, რომლებსაც სწავლებისას ამუშავებს. ChatGPT არ „აკოპირებს და ჩასვამს“ თავისი სასწავლო მონაცემებიდან — ისევე როგორც მასწავლებელს, extensive სწავლის შემდეგ, შეუძლია ცნებების ახსნა იდეებს შორის კავშირების გაგებით, ორიგინალი მასალების ზეპირად დამახსოვრების ან სიტყვასიტყვით გამეორების გარეშე. მომხმარებლის მოთხოვნაზე პასუხის შექმნისას მოდელი ამ ნასწავლ წონებს იყენებს ახალი შიგთავსის პროგნოზირებისა და შესაქმნელად.

რა ტიპის ინფორმაცია გამოიყენება ChatGPT-ის სასწავლებლად?

საჯაროდ ხელმისაწვდომი ინტერნეტშიგთავსის შემთხვევაში ვიყენებთ მხოლოდ იმ ინფორმაციას, რომელიც ინტერნეტში თავისუფლად და ღიად არის ხელმისაწვდომი. ეს შეიძლება მოიცავდეს საჯაროდ ხელმისაწვდომ ვებგვერდებს, საჯარო ფორუმებს, საჯარო ბლოგებს, საჯარო პოსტებს და სხვა საჯაროდ ხელმისაწვდომ ონლაინ შიგთავსს. მაგალითად, თუ მონაწილეობთ საჯაროდ ხელმისაწვდომ ონლაინ სადისკუსიო ფორუმში ან აქვეყნებთ საჯარო ბლოგს ან სხვა პოსტს, შეიძლება ეს საჯაროდ ხელმისაწვდომი შიგთავსი მოდელის სწავლების მიზნებისთვის გამოვიყენოთ. თუმცა, ვდგამთ ნაბიჯებს, რათა სწავლების პროცესში პერსონალური ინფორმაციის დამუშავება შევამციროთ.  საჯაროდ ხელმისაწვდომი ინტერნეტშიგთავსის შეგროვებისას განზრახ არ ვაგროვებთ მონაცემებს ისეთი წყაროებიდან, რომლებიც, როგორც ცნობილია, ფასიანი წვდომის მიღმაა ან ბნელ ვებში მდებარეობს. გარდა ამისა, ვიყენებთ ფილტრებს იმ მასალის მოსაშორებლად, რომლისგანაც არ გვინდა, რომ ჩვენმა მოდელებმა ისწავლონ, როგორიცაა სიძულვილის ენა, ზრდასრულთა შიგთავსი, პერსონალური ინფორმაციის შემკრები საიტები და სპამი. შემდეგ დარჩენილი ინფორმაცია ჩვენი მოდელების სასწავლებლად გამოიყენება. 

ვებსაიტების მფლობელებს შეუძლიათ მართონ, შეიძლება თუ არა მათი საიტებიდან საჯაროდ ხელმისაწვდომ შიგთავსზე წვდომა სწავლების მიზნით, სტანდარტული ვებკონტროლების, მაგალითად robots.txt-ის, გამოყენებით GPTBot-ის დასაბლოკად, რომელსაც შეუძლია საჯაროდ ხელმისაწვდომი შიგთავსის დათვალიერება ჩვენი მოდელების სწავლების დასახმარებლად. ვებსაიტების მფლობელებს ვთავაზობთ სახელმძღვანელო მითითებებს, რომლებიც ეხმარება მათ მართონ, როგორ ურთიერთქმედებს მათი საიტები და შიგთავსი ჩვენს AI სისტემებთან. 

ჩვენ ასევე ვიყენებთ ინფორმაციას მესამე მხარე პარტნიორებისგან, რათა ჩვენი მოდელების სწავლება და გაუმჯობესება დავეხმაროთ. ეს შეიძლება მოიცავდეს ინფორმაციას მონაცემთა ნაკრებებში, რომლებზეც წვდომას მესამე მხარეებთან შეთანხმებების საფუძველზე ვიღებთ, ასევე ადამიან-ტრენერებისა და მკვლევრების მიერ მოწოდებულ ან შექმნილ ინფორმაციას, როცა ეს ჩვენი პოლიტიკებისა და შეთანხმებების მიხედვით ნებადართულია. ეს ჩვენი მოდელების ხარისხის, უსაფრთხოებისა და მუშაობის გაუმჯობესებას უწყობს ხელს. ეს წყაროები შეიძლება მოიცავდეს ტექსტს, სურათებს, აუდიოს, ვიდეოს ან მონაცემთა სხვა ტიპებს, მონაცემთა ნაკრებიდან გამომდინარე.

ზოგიერთ სასწავლო პროცესში სულ უფრო მეტად ვიყენებთ სინთეზურ მონაცემებსაც. მაგალითად, შეიძლება გამოვიყენოთ ინფორმაცია და ჩვენი მოდელები სინთეზური მოთხოვნების, მრავალენოვანი მაგალითების ან სხვა სასწავლო მასალების შესაქმნელად. სინთეზურ მონაცემებს შეუძლია გააუმჯობესოს მოდელის მუშაობა, მათ შორის სასწავლო მონაცემების შევსებით იმ სფეროებში, სადაც მონაცემები მწირია ან დაუბალანსებელია, და ასევე ხელი შეუწყოს მოდელის შემუშავების კონფიდენციალურობის გამაძლიერებელ მიდგომებს.

გამოიყენება თუ არა პერსონალური ინფორმაცია ChatGPT-ის სასწავლებლად?

ონლაინ შიგთავსის მნიშვნელოვანი ნაწილი ადამიანების შესახებ ინფორმაციას მოიცავს, ამიტომ ჩვენი სასწავლო მონაცემები შეიძლება შემთხვევით შეიცავდეს პერსონალურ ინფორმაციას. თუმცა, ვდგამთ ნაბიჯებს, რათა სწავლების პროცესში პერსონალური ინფორმაციის დამუშავება შევამციროთ.

სასწავლო მონაცემებს ვიყენებთ მოდელის შესაძლებლობების — როგორიცაა პროგნოზირება, მსჯელობა და პრობლემების გადაჭრა — განვითარებისთვის და არა ინდივიდების პროფილების შესაქმნელად, მათთან დასაკავშირებლად ან მათთვის რეკლამების პერსონალიზებისთვის.

ზოგიერთ შემთხვევაში, მოდელებმა შეიძლება პერსონალური ინფორმაციიდან ისწავლონ, როგორ ფუნქციონირებს ენაში ისეთი ელემენტები, როგორიცაა სახელები და მისამართები, ან როგორ ამოიცნონ საჯარო პირები და ცნობილი სუბიექტები. ეს მოდელს ეხმარება უფრო ზუსტი და კონტექსტურად შესაფერისი პასუხების შექმნაში.

როგორ არის დაცული პერსონალური ინფორმაცია სწავლებისას?

სწავლებისას პერსონალური ინფორმაციის დამუშავების შესაზღუდად აქტიურ ნაბიჯებს ვდგამთ. მაგალითად, გამოვრიცხავთ ცნობილ წყაროებს, რომლებიც დიდი მოცულობით პერსონალურ მონაცემებს აგროვებენ, ვიყენებთ ფილტრაციას სწავლების პროცესში პერსონალური ინფორმაციის შესამცირებლად და ვდგამთ ნაბიჯებს დუბლირებული შიგთავსის გამოსავლენად და მოსაშორებლად, რათა სასწავლო მონაცემების გამეორების რისკი შევამციროთ. გარდა ამისა, ჩვენს მოდელებს ვასწავლით, რომ თავი აარიდონ ინდივიდების შესახებ პირად ან მგრძნობიარე ინფორმაციაზე მოთხოვნებზე პასუხს. 

რამდენ ხანს ვინახავთ ინფორმაციას

სასწავლო მონაცემებში ინფორმაციას ვინახავთ მხოლოდ იმდენ ხანს, რამდენიც გონივრულად აუცილებელია ამ სტატიასა და ჩვენს კონფიდენციალურობის წესებში აღწერილი მიზნებისთვის, მათ შორის ჩვენი მოდელების შესაქმნელად და გასაუმჯობესებლად და დაკავშირებული სამეცნიერო კვლევის მიზნებისთვის. შენახვა პერიოდულად მოწმდება, რათა დადასტურდეს მისი მუდმივი აუცილებლობა, და განსხვავდება ინფორმაციის ტიპისა და მისი გამოყენების მიხედვით. შენახვის განსაზღვრისას ვითვალისწინებთ ისეთ ფაქტორებს, როგორიცაა ინფორმაციის დამუშავების მიზანი, ინფორმაციის მოცულობა, ხასიათი და მგრძნობიარობა, უნებართვო გამოყენებით ან გამჟღავნებით შესაძლო ზიანის რისკი და ნებისმიერი სამართლებრივი ვალდებულება, რომელიც ჩვენზე ვრცელდება.

როგორ შეესაბამება ChatGPT-ის განვითარება კონფიდენციალურობის კანონებს?

სასწავლო ინფორმაციას კანონიერად ვიყენებთ. ჩვენი საბაზისო მოდელები უზრუნველყოფს სასარგებლო აპლიკაციების ფართო სპექტრს — მათ შორის ხელმისაწვდომობის ხელსაწყოებს, მომხმარებელთა მხარდაჭერას, პროგრამული უზრუნველყოფის განვითარებას, პერსონალიზებულ განათლებასა და სამეცნიერო კვლევას. ეს შესაძლებლობები დამოკიდებულია მასშტაბიანი ტრენინგის მონაცემებზე, მათ შორის საჯაროდ ხელმისაწვდომ ინფორმაციასა და მესამე მხარე პარტნიორებისგან მიღებულ ინფორმაციაზე. სწავლების მთელი პროცესის განმავლობაში ვიყენებთ დამცავ ზომებს, მათ შორის ნაბიჯებს, რომლებიც შექმნილია სასწავლო პროცესში პერსონალური ინფორმაციის დამუშავების შესამცირებლად და რისკების შესამსუბუქებლად, როგორც ამ სტატიაშია აღწერილი. სასწავლო ინფორმაციაში შემავალი პერსონალური ინფორმაციის შეგროვებასა და გამოყენებას ვაფუძნებთ კონფიდენციალურობის კანონებით, როგორიცაა GDPR, გათვალისწინებულ ლეგიტიმურ ინტერესებს, მათ შორის ჩვენი მოდელების სწავლებისა და გაუმჯობესებისთვის მომხმარებლებისა და ფართო საზოგადოების სასარგებლოდ, ჩვენი მისიის შესაბამისად, რომ ზოგადი ხელოვნური ინტელექტი ყველასთვის სასარგებლო იყოს, რაც უფრო დეტალურად განმარტებულია ჩვენს კონფიდენციალურობის წესებში. დავასრულეთ მონაცემთა დაცვის ზემოქმედების შეფასება, რათა დაგვეხმაროს დავრწმუნდეთ, რომ ამ ინფორმაციას კანონიერად და პასუხისმგებლობით ვაგროვებთ და ვიყენებთ.

როდის შეიძლება ინფორმაციის გაზიარება ან გადაცემა

ჩვენ არ „ვყიდით“ პერსონალურ ინფორმაციას და სასწავლო მონაცემებში არსებულ პერსონალურ ინფორმაციას ვამჟღავნებთ მხოლოდ ჩვენს კონფიდენციალურობის წესებში აღწერილ შეზღუდულ გარემოებებში. მაგალითად, შეიძლება ინფორმაცია გავუზიაროთ აფილირებულ პირებს, მომწოდებლებსა და სერვისის პროვაიდერებს, რომლებიც ჩვენი მოდელების განვითარებას, ტესტირებასა და გაუმჯობესებას უჭერენ მხარს. ასევე შეიძლება ინფორმაცია გავამჟღავნოთ კეთილსინდისიერი რწმენით, რომ ასეთი ქმედება აუცილებელია სამართლებრივი ვალდებულების შესასრულებლად ან ჩვენი და ჩვენი მომხმარებლების, თანამშრომლების ან საზოგადოების უფლებების, უსაფრთხოებისა და დაცულობის დასაცავად, როგორც აღწერილია ჩვენს კონფიდენციალურობის წესებში.

რადგან ჩვენი ინფრასტრუქტურა გლობალურია, სასწავლო მონაცემებში არსებული პერსონალური ინფორმაცია შეიძლება დამუშავდეს EEA-ის, შვეიცარიის ან გაერთიანებული სამეფოს გარეთ მდებარე ქვეყნებში (მათ შორის შეერთებულ შტატებში). ასეთ შემთხვევაში ვიყენებთ შესაბამის დამცავ ზომებს, როგორიცაა ადეკვატურობის გადაწყვეტილებები ან სტანდარტული სახელშეკრულებო მუხლები, როგორც აღწერილია ჩვენს კონფიდენციალურობის წესებში.

თქვენი უფლებები და მათი განხორციელების გზა

ჩვენ ვპასუხობთ წინააღმდეგობის მოთხოვნებსა და მსგავს მოთხოვნებს უფლებების განხორციელების შესახებ. ენის სწავლების შედეგად, ChatGPT-ის პასუხები ზოგჯერ შეიძლება შეიცავდეს პერსონალურ ინფორმაციას იმ ადამიანების შესახებ, რომელთა პერსონალური ინფორმაცია საჯარო ინტერნეტში მრავალჯერ გვხვდება (მაგალითად, საჯარო პირები). გარკვეულ იურისდიქციებში ინდივიდებს შეუძლიათ შეეწინააღმდეგონ მათი პერსონალური ინფორმაციის ჩვენი მოდელების მიერ დამუშავებას ან მონაცემთა სუბიექტის უფლებებთან დაკავშირებული სხვა მოთხოვნები წარადგინონ ჩვენი კონფიდენციალურობის პორტალის მეშვეობით. ამ უფლებების განხორციელება ასევე შეგიძლიათ privacy@openai.com-თან დაკავშირებით. 

თქვენი მოთხოვნის შეფასებასა და პასუხში რომ დაგვეხმაროთ, გთხოვთ მოგვაწოდოთ საკმარისი ინფორმაცია, რათა გავიგოთ, რომელ პერსონალურ ინფორმაციას ეხება თქვენი მოთხოვნა, მაგალითად თქვენი სახელი, შესაბამისი URL-ები, მოდელის შედეგების კონკრეტული მაგალითები ან სხვა დეტალები, რომლებიც საკითხის იდენტიფიცირებაში გვეხმარება. ზოგიერთ შემთხვევაში, სანამ მოქმედებას შევძლებთ, შეიძლება გთხოვოთ თქვენი იდენტობის დადასტურება ან იმის დადასტურება, რომ ინფორმაცია თქვენ გეხებათ. დამატებითი ინფორმაცია ამ მოთხოვნების წარდგენის შესახებ, მათ შორის საუკეთესო პრაქტიკები და მოთხოვნების განხილვის წესი, ხელმისაწვდომია ჩვენს დახმარების ცენტრის სტატიაში ChatGPT-დან პერსონალური მონაცემების წაშლის შესახებ. მოთხოვნებს განვიხილავთ მოქმედი კონფიდენციალურობის კანონების შესაბამისად და ვპასუხობთ მოქმედი სამართლებრივი ვადების ფარგლებში.

გთხოვთ გაითვალისწინოთ, რომ კონფიდენციალურობის კანონების შესაბამისად, ზოგიერთი უფლება შეიძლება აბსოლუტური არ იყოს. მაგალითად, შეიძლება ვერ შევასრულოთ მოთხოვნა, თუ ვერ ვადასტურებთ შესაბამის ინფორმაციას, თუ მოთხოვნა არ ეხება OpenAI-ის მიერ დამუშავებულ პერსონალურ ინფორმაციას, თუ მოქმედებს გამონაკლისი ან თუ ამისთვის სხვა კანონიერი საფუძველი გვაქვს. მოთხოვნები თითოეული შემთხვევის მიხედვით ფასდება და შეიძლება მოიცავდეს კონფიდენციალურობის უფლებების დაბალანსებას სხვა მნიშვნელოვან მოსაზრებებთან, როგორიცაა გამოხატვის თავისუფლება და საჯარო ინტერესი. 

თუმცა, ვცდილობთ პრიორიტეტი მივანიჭოთ პერსონალური ინფორმაციის დაცვას და ვიცავთ ყველა მოქმედ კონფიდენციალურობის კანონს. თუ ფიქრობთ, რომ საკითხი სათანადოდ არ განგვიხილავს, უფლება გაქვთ საჩივარი შეიტანოთ თქვენს ადგილობრივ საზედამხედველო ორგანოში.

დამატებითი ინფორმაციისთვის OpenAI-ის პრაქტიკების შესახებ იმ პერსონალურ ინფორმაციასთან დაკავშირებით, რომელსაც თქვენგან ან თქვენ შესახებ ვაგროვებთ ჩვენი ვებსაიტის, აპლიკაციებისა და სერვისების გამოყენებისას, იხილეთ ჩვენი კონფიდენციალურობის წესები.

სასარგებლო იყო ეს სტატია?