OpenAI-ის საბაზისო მოდელები, მათ შორის მოდელები, რომლებზეც ChatGPT მუშაობს, ინფორმაციის სამი ძირითადი წყაროს გამოყენებით იქმნება: (1) ინტერნეტში საჯაროდ ხელმისაწვდომი ინფორმაცია, (2) ინფორმაცია, რომელზე წვდომასაც მესამე მხარეებთან თანამშრომლობით ვიღებთ და (3) ინფორმაცია, რომელსაც ჩვენი მომხმარებლები, ტრენერები და მკვლევრები გვაწვდიან ან ქმნიან.
ChatGPT-ში გამოყენებული საბაზისო მოდელების შექმნა რამდენიმე ეტაპს მოიცავს, მათ შორის სასწავლო მონაცემების მომზადებას, წინასწარ სწავლებასა და შემდგომ სწავლებას, აგრეთვე დანერგვის შემდეგ უწყვეტ შეფასებასა და გაუმჯობესებას. ამ ეტაპებზე სხვადასხვა მიზნით შეიძლება სხვადასხვა ტიპის ინფორმაცია გამოვიყენოთ, მათ შორის მოდელის მუშაობის, საიმედოობისა და უსაფრთხოების გასაუმჯობესებლად.
ამ სტატიაში მიმოხილულია ინფორმაცია, რომელსაც ამ მოდელების შექმნისთვის ვიყენებთ, როგორ ვაგროვებთ და ვიყენებთ მას კონფიდენციალურობის კანონების დაცვით და რა დამცავ ზომებს ვიღებთ სწავლების მთელი პროცესის განმავლობაში. იმის გასაგებად, თუ როგორ ვაგროვებთ და ვიყენებთ ჩვენი სერვისების მომხმარებელთა ინფორმაციას, მათ შორის როგორ შეგიძლიათ უარი თქვათ ChatGPT-სთან თქვენი საუბრების ჩვენი მოდელების გაუმჯობესებისთვის გამოყენებაზე, გაეცანით ჩვენს კონფიდენციალურობის წესებს და დახმარების ცენტრის ამ სტატიას.
რა არის ChatGPT და როგორ მუშაობს ის?
ChatGPT ხელოვნურ ინტელექტზე დაფუძნებული სერვისია, რომლითაც ინტერნეტის ან აპის მეშვეობით შეგიძლიათ ისარგებლოთ. ChatGPT შეგიძლიათ მრავალი ამოცანისთვის გამოიყენოთ, მათ შორის ინფორმაციის დასალაგებლად და შესაჯამებლად, თარგმნის, პროგრამირების, კვლევისა და ანალიზის დასახმარებლად, სხვადასხვა ხელსაწყოში მრავალეტაპიანი ამოცანების შესასრულებლად, სურათების გასაანალიზებლად ან შესაქმნელად, შემოქმედებითი პროცესისა და იდეების წასახალისებლად და სხვა ყოველდღიური საქმიანობისთვის. ChatGPT შექმნილია იმისთვის, რომ გაიგოს მომხმარებლების კითხვები და მითითებები და უპასუხოს მათ ტექსტის, სურათების, აუდიოსა და ვიდეოს ჩათვლით დიდი მოცულობის ინფორმაციაში არსებული კანონზომიერებების შესწავლის საფუძველზე.
სწავლებისას მოდელი აანალიზებს ამ მონაცემებში არსებულ კავშირებს — მაგალითად, კონტექსტში სიტყვების ერთად გამოყენების ტიპურ წესებს — და მიღებულ ცოდნას პასუხის შექმნისას მომდევნო ყველაზე სავარაუდო სიტყვის სათითაოდ გამოსაცნობად იყენებს. ტექსტი შეიძლება დაიყოს მცირე ერთეულებად, რომლებსაც ზოგჯერ „ტოკენებს“ უწოდებენ და რომლებიც შეიძლება მთლიან სიტყვებს, სიტყვების ნაწილებს ან სასვენ ნიშნებს წარმოადგენდეს. ტოკენები ტექსტის ის შემადგენელი ერთეულებია, რომლებსაც მოდელი ამუშავებს. მსგავსადვე, მოდელები, რომლებიც სხვა სახის შიგთავსს, მაგალითად სურათებს ქმნიან, სწავლობენ კანონზომიერებებს, თუ როგორ უკავშირდება პიქსელები ერთმანეთს და სასწავლო მონაცემებში მათთან დაკავშირებულ აღწერებს.
მაგალითად, მოდელის სწავლის პროცესში (რომელსაც „სწავლებას“ უწოდებენ) მას შეიძლება დაევალოს ასეთი წინადადების დასრულება: „მარცხნივ მოხვევის ნაცვლად, ის ___ მოხვდა.“ სწავლების საწყის ეტაპზე მისი პასუხები ძირითადად შემთხვევითია. თუმცა, დიდი მოცულობის ტექსტის დამუშავებისა და მისგან სწავლის შედეგად მოდელი უკეთ ამოიცნობს კანონზომიერებებს და უფრო ზუსტად პროგნოზირებს მომდევნო ყველაზე სავარაუდო სიტყვას. ეს პროცესი მილიონობით წინადადებაზე მეორდება, რათა მოდელმა უკეთ გაიაზროს მასალა და მისი სიზუსტე გაიზარდოს.
რადგან წინადადების დასრულების რამდენიმე დამაჯერებელი გზა არსებობს — მაგალითად, „მარცხნივ მოხვევის ნაცვლად, ის მარჯვნივ მოხვდა“, „შემობრუნდა“ ან „უკან დაბრუნდა“ — მოდელის პასუხებში შემთხვევითობის ელემენტი გარდაუვალია. შედეგად, ერთი და იმავე კითხვის ხელახლა დასმისას შეიძლება განსხვავებული პასუხები მიიღოთ.
მანქანური სწავლების მოდელები შედგება რიცხვების დიდი ნაკრებებისგან, რომლებსაც „წონები“ ან „პარამეტრები“ ეწოდება, და კოდისგან, რომელიც ამ რიცხვებს განმარტავს და იყენებს. ეს მოდელები არ ინახავენ იმ მონაცემების ასლებს, რომლებზეც მათ ასწავლიან. ამის ნაცვლად, სწავლის პროცესში მოდელის პარამეტრების მნიშვნელობები ოდნავ იცვლება მის მიერ აღმოჩენილი კანონზომიერებების ასახვის მიზნით. წინა მაგალითში მოდელი შემთხვევითი სიტყვების პროგნოზირებიდან უფრო ზუსტ პროგნოზებზე გადავიდა არა სასწავლო წინადადებების შენახვით, არამედ საკუთარი შიდა პარამეტრების განახლებით. მოდელი არ ინახავს სწავლებისას დამუშავებული წინადადებების, სურათების ან აუდიოს ასლებს. ChatGPT სასწავლო მონაცემებიდან არაფერს „აკოპირებს და სვამს“ — ის ჰგავს მასწავლებელს, რომელსაც საფუძვლიანი შესწავლის შემდეგ შეუძლია ცნებების ახსნა იდეებს შორის კავშირების გააზრებით, თავდაპირველი მასალის ზეპირად დამახსოვრების ან სიტყვასიტყვით გამეორების გარეშე. მომხმარებლის მოთხოვნაზე პასუხის შექმნისას მოდელი ამ ნასწავლ წონებს ახალი შიგთავსის პროგნოზირებისა და შექმნისთვის იყენებს.
რა ტიპის ინფორმაციას იყენებენ ChatGPT-ის სასწავლებლად?
ინტერნეტის საჯაროდ ხელმისაწვდომი შიგთავსიდან მხოლოდ იმ ინფორმაციას ვიყენებთ, რომელზეც ინტერნეტში თავისუფალი და ღია წვდომაა. ეს შეიძლება მოიცავდეს საჯაროდ ხელმისაწვდომ ვებგვერდებს, ღია ფორუმებსა და ბლოგებს, საჯარო პოსტებს და ინტერნეტში საჯაროდ ხელმისაწვდომ სხვა შიგთავსს. მაგალითად, თუ საჯაროდ ხელმისაწვდომ ონლაინფორუმში მსჯელობთ ან საჯარო ბლოგში თუ სხვაგან პოსტს აქვეყნებთ, შეიძლება ეს საჯაროდ ხელმისაწვდომი შიგთავსი მოდელის სწავლებისთვის გამოვიყენოთ. თუმცა, სწავლების პროცესში პერსონალური ინფორმაციის დამუშავების შესამცირებლად ზომებს ვიღებთ. ინტერნეტში საჯაროდ ხელმისაწვდომი შიგთავსის შეგროვებისას განზრახ არ ვიღებთ მონაცემებს იმ წყაროებიდან, რომლებიც, ჩვენი ინფორმაციით, ფასიანი წვდომის შეზღუდვის მიღმა ან ბნელ ქსელშია განთავსებული. გარდა ამისა, ფილტრებით ვშლით მასალას, რომელზეც არ გვსურს ჩვენი მოდელების სწავლება, მათ შორის სიძულვილის ენას, ზრდასრულთათვის განკუთვნილ შიგთავსს, პერსონალური ინფორმაციის შემკრებ საიტებსა და სპამს. დარჩენილი ინფორმაცია შემდეგ ჩვენი მოდელების სასწავლებლად გამოიყენება.
ვებსაიტების მფლობელებს შეუძლიათ, სტანდარტული ვებკონტროლის საშუალებებით, როგორიცაა robots.txt, მართონ, შეიძლება თუ არა მათი საიტების საჯაროდ ხელმისაწვდომ შიგთავსზე სწავლების მიზნით წვდომა. ამისათვის მათ შეუძლიათ აკრძალონ GPTBot, რომელმაც ჩვენი მოდელების სწავლების ხელშესაწყობად შეიძლება საჯაროდ ხელმისაწვდომი შიგთავსი მოიძიოს. ჩვენ ვებსაიტების მფლობელებს ვთავაზობთ მითითებებს, რომლებიც მათ საკუთარი საიტებისა და შიგთავსის ჩვენს ხელოვნური ინტელექტის სისტემებთან ურთიერთქმედების მართვაში დაეხმარება.
ჩვენი მოდელების სწავლებისა და გაუმჯობესების ხელშესაწყობად მესამე მხარე პარტნიორების ინფორმაციასაც ვიყენებთ. ეს შეიძლება მოიცავდეს მონაცემთა ნაკრებებში არსებულ ინფორმაციას, რომელზეც მესამე მხარეებთან დადებული შეთანხმებებით გვაქვს წვდომა, აგრეთვე ტრენერებისა და მკვლევრების მიერ მოწოდებულ ან შექმნილ ინფორმაციას, როცა ამას ჩვენი წესები და შეთანხმებები უშვებს. ეს ჩვენი მოდელების ხარისხის, უსაფრთხოებისა და მუშაობის გაუმჯობესებას უწყობს ხელს. მონაცემთა ნაკრების მიხედვით, ეს წყაროები შეიძლება მოიცავდეს ტექსტს, სურათებს, აუდიოს, ვიდეოს ან სხვა ტიპის მონაცემებს.
სწავლების ზოგიერთ პროცესში სულ უფრო ხშირად ვიყენებთ სინთეზურ მონაცემებსაც. მაგალითად, ინფორმაციისა და ჩვენი მოდელების გამოყენებით შეიძლება შევქმნათ სინთეზური მოთხოვნები, მრავალენოვანი მაგალითები ან სხვა სასწავლო მასალა. სინთეზური მონაცემები მოდელის მუშაობის გაუმჯობესებას უწყობს ხელს, მათ შორის სასწავლო მონაცემების შევსებით იმ სფეროებში, სადაც მონაცემები მწირია ან არათანაბრადაა განაწილებული. ის ასევე შეიძლება ხელს უწყობდეს მოდელების შექმნისას კონფიდენციალურობის უკეთ დაცვის მეთოდების გამოყენებას.
გამოიყენება თუ არა პერსონალური ინფორმაცია ChatGPT-ის სასწავლებლად?
ონლაინშიგთავსის მნიშვნელოვანი ნაწილი ადამიანების შესახებ ინფორმაციას მოიცავს, ამიტომ პერსონალური ინფორმაცია შეიძლება შემთხვევით ჩვენს სასწავლო მონაცემებშიც მოხვდეს. თუმცა, სწავლების პროცესში პერსონალური ინფორმაციის დამუშავების შესამცირებლად ზომებს ვიღებთ.
სასწავლო მონაცემებს მოდელის ისეთი შესაძლებლობების გასავითარებლად ვიყენებთ, როგორიცაა პროგნოზირება, მსჯელობა და პრობლემების გადაჭრა, და არა ადამიანების პროფილების შესაქმნელად, მათთან დასაკავშირებლად ან მათზე მორგებული რეკლამის საჩვენებლად.
ზოგ შემთხვევაში მოდელებმა პერსონალური ინფორმაციისგან შეიძლება ისწავლონ, თუ როგორ გამოიყენება ენაში სახელები და მისამართები, ან როგორ ამოიცნონ საჯარო პირები და ცნობილი სუბიექტები. ეს მოდელს უფრო ზუსტი და კონტექსტის შესაბამისი პასუხების შექმნაში ეხმარება.
როგორ არის დაცული პერსონალური ინფორმაცია სწავლებისას?
სწავლებისას პერსონალური ინფორმაციის დამუშავების შესაზღუდად აქტიურ ზომებს ვიღებთ. მაგალითად, გამოვრიცხავთ ცნობილ წყაროებს, რომლებიც დიდი რაოდენობით პერსონალურ მონაცემებს აგროვებს, სწავლების პროცესში პერსონალური ინფორმაციის შესამცირებლად ვიყენებთ ფილტრებს და ვცდილობთ, ამოვიცნოთ და წავშალოთ დუბლირებული შიგთავსი, რათა შემცირდეს სასწავლო მონაცემების გამეორების რისკი. გარდა ამისა, ჩვენს მოდელებს ვასწავლით, არ უპასუხონ ადამიანების პირადი ან მგრძნობიარე ინფორმაციის მოთხოვნებს.
რამდენ ხანს ვინახავთ ინფორმაციას
სასწავლო მონაცემებში ინფორმაციას ვინახავთ მხოლოდ იმდენ ხანს, რამდენიც გონივრულად აუცილებელია ამ სტატიასა და ჩვენს კონფიდენციალურობის წესებში აღწერილი მიზნებისთვის, მათ შორის ჩვენი მოდელების შექმნისა და გაუმჯობესებისთვის და მასთან დაკავშირებული სამეცნიერო კვლევებისთვის. ინფორმაციის შენახვის საჭიროებას პერიოდულად განვიხილავთ, ხოლო შენახვის ვადა დამოკიდებულია ინფორმაციის ტიპსა და მისი გამოყენების წესზე. შენახვის ვადის განსაზღვრისას ვითვალისწინებთ ისეთ ფაქტორებს, როგორიცაა ინფორმაციის დამუშავების მიზანი, ინფორმაციის მოცულობა, ხასიათი და მგრძნობელობა, უნებართვო გამოყენებით ან გამჟღავნებით ზიანის მიყენების შესაძლო რისკი და ჩვენზე დაკისრებული სამართლებრივი ვალდებულებები.
როგორ შეესაბამება ChatGPT-ის შექმნა კონფიდენციალურობის კანონებს?
სასწავლო ინფორმაციას კანონის შესაბამისად ვიყენებთ. ჩვენი საბაზისო მოდელები მრავალი სასარგებლო აპლიკაციის მუშაობას უზრუნველყოფს, მათ შორის ხელმისაწვდომობის ხელსაწყოების, მომხმარებელთა მხარდაჭერის, პროგრამული უზრუნველყოფის შექმნის, ინდივიდუალურად მორგებული განათლებისა და სამეცნიერო კვლევების. ეს შესაძლებლობები დამოკიდებულია მასშტაბიანი ტრენინგის მონაცემებზე, მათ შორის საჯაროდ ხელმისაწვდომ ინფორმაციასა და მესამე მხარე პარტნიორებისგან მიღებულ ინფორმაციაზე. სწავლების მთელი პროცესის განმავლობაში ვიყენებთ დამცავ ზომებს, მათ შორის ამ სტატიაში აღწერილ ნაბიჯებს, რომლებიც სწავლების პროცესში პერსონალური ინფორმაციის დამუშავებისა და რისკების შემცირებას ემსახურება. სასწავლო ინფორმაციაში შეტანილი პერსონალური ინფორმაციის შეგროვებასა და გამოყენებას ვაფუძნებთ კონფიდენციალურობის კანონებით, როგორიცაა GDPR, გათვალისწინებულ ლეგიტიმურ ინტერესებზე. ეს მოიცავს ჩვენი მოდელების სწავლებასა და გაუმჯობესებას მომხმარებლებისა და ფართო საზოგადოების სასარგებლოდ, ჩვენი მისიის შესაბამისად, უზრუნველვყოთ, რომ ზოგადი ხელოვნური ინტელექტი ყველასთვის სასარგებლო იყოს. დამატებითი ინფორმაცია იხილეთ ჩვენს კონფიდენციალურობის წესებში. ჩვენ ჩავატარეთ მონაცემთა დაცვაზე ზემოქმედების შეფასება, რათა უზრუნველვყოთ ამ ინფორმაციის კანონიერი და პასუხისმგებლობიანი შეგროვება და გამოყენება.
როდის შეიძლება ინფორმაციის გაზიარება ან გადაცემა
ჩვენ პერსონალურ ინფორმაციას არ „ვყიდით“ და სასწავლო მონაცემებში არსებულ პერსონალურ ინფორმაციას მხოლოდ ჩვენს კონფიდენციალურობის წესებში აღწერილ შეზღუდულ შემთხვევებში ვამჟღავნებთ. მაგალითად, ინფორმაცია შეიძლება გავუზიაროთ აფილირებულ ორგანიზაციებს, მომწოდებლებსა და მომსახურების პროვაიდერებს, რომლებიც ჩვენი მოდელების შექმნას, გამოცდასა და გაუმჯობესებას უწყობენ ხელს. ინფორმაცია შეიძლება ასევე გავამჟღავნოთ, თუ კეთილსინდისიერად მიგვაჩნია, რომ ეს აუცილებელია სამართლებრივი ვალდებულების შესასრულებლად ან ჩვენი, ჩვენი მომხმარებლების, თანამშრომლებისა თუ საზოგადოების უფლებების, უსაფრთხოებისა და დაცულობის უზრუნველსაყოფად, როგორც აღწერილია ჩვენს კონფიდენციალურობის წესებში.
რადგან ჩვენი ინფრასტრუქტურა გლობალურია, სასწავლო მონაცემებში არსებული პერსონალური ინფორმაცია შეიძლება დამუშავდეს ევროპის ეკონომიკური სივრცის, შვეიცარიის ან გაერთიანებული სამეფოს ფარგლებს გარეთ მდებარე ქვეყნებში, მათ შორის შეერთებულ შტატებში. ასეთ შემთხვევებში ვიყენებთ სათანადო დამცავ ზომებს, როგორიცაა ადეკვატურობის შესახებ გადაწყვეტილებები ან სტანდარტული სახელშეკრულებო პირობები, როგორც აღწერილია ჩვენს კონფიდენციალურობის წესებში.
თქვენი უფლებები და მათი გამოყენების გზები
ჩვენ ვპასუხობთ დამუშავებაზე პროტესტისა და მსგავსი უფლებების გამოყენების მოთხოვნებს. ენის შესწავლის შედეგად ChatGPT-ის პასუხები ზოგჯერ შეიძლება შეიცავდეს პერსონალურ ინფორმაციას იმ ადამიანების შესახებ, რომელთა პერსონალური ინფორმაციაც საჯარო ინტერნეტში არაერთხელ გვხვდება, მაგალითად საჯარო პირების შესახებ. გარკვეულ იურისდიქციებში ადამიანებს შეუძლიათ გააპროტესტონ ჩვენი მოდელების მიერ მათი პერსონალური ინფორმაციის დამუშავება ან მონაცემთა სუბიექტის სხვა უფლებების გამოყენება მოითხოვონ ჩვენი კონფიდენციალურობის პორტალის მეშვეობით. ამ უფლებებით სარგებლობა ასევე შეგიძლიათ მისამართზე privacy@openai.com მოგვწეროთ.
თქვენი მოთხოვნის შეფასებასა და მასზე პასუხის გაცემაში დასახმარებლად მოგვაწოდეთ საკმარისი ინფორმაცია იმის გასაგებად, თუ რომელ პერსონალურ ინფორმაციას ეხება მოთხოვნა, მაგალითად თქვენი სახელი, შესაბამისი URL-ები, მოდელის შედეგების კონკრეტული მაგალითები ან სხვა დეტალები, რომლებიც საკითხის ამოცნობაში დაგვეხმარება. ზოგ შემთხვევაში, რეაგირებამდე შეიძლება მოგთხოვოთ ვინაობის დადასტურება ან იმის დასტური, რომ ინფორმაცია თქვენ გეხებათ. ამ მოთხოვნების წარდგენის, მათ შორის საუკეთესო პრაქტიკისა და მოთხოვნების განხილვის შესახებ დამატებითი ინფორმაცია ხელმისაწვდომია ChatGPT-დან პერსონალური მონაცემების წაშლის შესახებ ჩვენი დახმარების ცენტრის სტატიაში. მოთხოვნებს კონფიდენციალურობის მოქმედი კანონების შესაბამისად განვიხილავთ და კანონით დადგენილ ვადებში ვპასუხობთ.
გაითვალისწინეთ, რომ კონფიდენციალურობის კანონების თანახმად, ზოგიერთი უფლება შეიძლება აბსოლუტური არ იყოს. მაგალითად, მოთხოვნა შეიძლება ვერ შევასრულოთ, თუ შესაბამის ინფორმაციას ვერ ვამოწმებთ, მოთხოვნა არ ეხება OpenAI-ის მიერ დამუშავებულ პერსონალურ ინფორმაციას, მოქმედებს გამონაკლისი ან ამისთვის სხვა კანონიერი საფუძველი გვაქვს. თითოეულ მოთხოვნას ინდივიდუალურად ვაფასებთ, რაც შეიძლება მოითხოვდეს კონფიდენციალურობის უფლებების შეჯერებას სხვა მნიშვნელოვან მოსაზრებებთან, როგორიცაა გამოხატვის თავისუფლება და საზოგადოებრივი ინტერესი.
თუმცა, ვცდილობთ, პრიორიტეტი მივანიჭოთ პერსონალური ინფორმაციის დაცვას და დავიცვათ კონფიდენციალურობის ყველა მოქმედი კანონი. თუ მიგაჩნიათ, რომ საკითხზე სათანადოდ არ გვირეაგირია, უფლება გაქვთ, საჩივრით მიმართოთ ადგილობრივ საზედამხედველო ორგანოს.
დამატებითი ინფორმაციისთვის OpenAI-ის პრაქტიკის შესახებ იმ პერსონალურ ინფორმაციასთან დაკავშირებით, რომელსაც ჩვენი ვებსაიტის, აპლიკაციებისა და სერვისების გამოყენებისას თქვენგან ან თქვენ შესახებ ვაგროვებთ, გაეცანით ჩვენს კონფიდენციალურობის წესებს.
