OpenAI-дың іргелі модельдері, соның ішінде ChatGPT-ті жұмыс істететін модельдер, ақпараттың үш негізгі көзі арқылы әзірленеді: (1) интернетте жалпыға қолжетімді ақпарат, (2) қол жеткізу үшін үшінші тараптармен серіктестік орнататын ақпарат және (3) пайдаланушыларымыз, адам жаттықтырушылар мен зерттеушілер ұсынатын немесе жасайтын ақпарат.
ChatGPT-те қолданылатын іргелі модельдерді әзірлеу бірнеше кезеңнен тұрады: үйрету деректерін дайындау, алдын ала үйрету және кейінгі үйрету, сондай-ақ іске қосылғаннан кейін үздіксіз бағалау мен жетілдіру. Осы кезеңдерде ақпараттың әртүрлі түрлері түрлі мақсатта, соның ішінде модель өнімділігін, сенімділігін және қауіпсіздігін жақсарту үшін пайдаланылуы мүмкін.
Бұл мақалада осы модельдерді әзірлеуге көмектесу үшін қандай ақпаратты пайдаланатынымыз, оны жекелік туралы заңдарға сай қалай жинап, қолданатынымыз және үйрету процесі бойы қандай қорғау шараларын қолданатынымыз шолып түсіндіріледі. Қызметтеріміздің пайдаланушыларынан ақпаратты қалай жинап, пайдаланатынымызды, соның ішінде ChatGPT сөйлесулерін модельдерімізді жақсарту үшін қолданудан қалай бас тартуға болатынын түсіну үшін Жекелік саясатымызды және осы көмек көрсету орталығы мақаласын қараңыз.
ChatGPT деген не және ол қалай жұмыс істейді?
ChatGPT — интернет немесе қолданба арқылы қол жеткізуге болатын жасанды интеллектке негізделген қызмет. ChatGPT-ті ақпаратты реттеу және қорытындылау, аудармаға көмектесу, кодтау, зерттеу және талдауды қолдау, құралдар арасында көпқадамды тапсырмаларды орындау, кескіндерді талдау немесе жасау, шығармашылық пен идеяларға шабыт беру және басқа күнделікті әрекеттер үшін пайдалануға болады. ChatGPT мәтін, кескін, аудио және бейне сияқты үлкен көлемдегі ақпараттан үлгілерді үйрену арқылы пайдаланушы сұрақтары мен нұсқауларын түсініп, оларға жауап беруге арналған.
Үйрету кезінде модель осы деректер ішіндегі байланыстарды, мысалы сөздердің контексте әдетте қалай қатар кездесетінін талдайды да, сол түсінікті жауап жасағанда келесі ең ықтимал сөзді біртіндеп болжау үшін пайдаланады. Мәтін кейде «токендер» деп аталатын шағын бірліктерге түрлендірілуі мүмкін; олар тұтас сөздерді, сөз бөліктерін немесе тыныс белгілерін білдіруі мүмкін. Токендер — модель өңдейтін мәтіннің құрылыс бөлшектері. Сол сияқты, кескін сияқты басқа мазмұн түрлерін жасайтын модельдер үйрету деректеріндегі пиксельдердің бір-бірімен және оларға қатысты сипаттамалармен қалай байланысатынындағы үлгілерді үйренеді.
Мысалы, модельдің үйрену процесінде («үйрету» деп аталады) оған мынадай сөйлемді аяқтау тапсырылуы мүмкін: «Солға бұрылудың орнына, ол ___ бұрылды». Үйретудің бастапқы кезеңінде оның жауаптары көбіне кездейсоқ болады. Алайда модель үлкен көлемдегі мәтінді өңдеп, одан үйренген сайын, үлгілерді жақсырақ танып, келесі ең ықтимал сөзді дәлірек болжай бастайды. Бұл процесс оның түсінігін нақтылап, дәлдігін арттыру үшін миллиондаған сөйлемде қайталанады.
Сөйлемді аяқтаудың бірнеше қисынды жолы бар болғандықтан — мысалы, «Солға бұрылудың орнына, ол оңға бұрылды», «айналып бұрылды» немесе «кері бұрылды» — модельдің жауап беруінде кездейсоқтықтың табиғи элементі болады. Сондықтан бір сұраққа әртүрлі сұрауларда әртүрлі жауап алынуы мүмкін.
Машиналық оқыту модельдері «салмақтар» немесе «параметрлер» деп аталатын үлкен сандар жиындарынан және сол сандарды түсіндіріп, пайдаланатын кодтан тұрады. Бұл модельдер өздері үйретілген деректердің көшірмелерін сақтамайды немесе ұстап тұрмайды. Оның орнына, модель үйренген сайын, анықтаған үлгілерді көрсету үшін оның параметр мәндері аздап түзетіледі. Алдыңғы мысалда модель кездейсоқ сөздерді болжаудан дәлірек болжам жасауға көшті — бұл үйрету сөйлемдерін сақтау арқылы емес, өзінің ішкі параметрлерін жаңарту арқылы болды. Модель үйрету кезінде өңдейтін сөйлемдердің, кескіндердің немесе аудионың көшірмелерін сақтамайды. ChatGPT үйрету деректерінен «көшіріп қоймайды» — бұл көп оқыған мұғалімнің бастапқы материалдарды жаттап алмай немесе сөзбе-сөз қайталамай, идеялар арасындағы байланыстарды түсіну арқылы ұғымдарды түсіндіре алатынына ұқсайды. Пайдаланушы сұрауына жауап жасағанда, модель осы үйренген салмақтарды пайдаланып, жаңа мазмұнды болжайды және жасайды.
ChatGPT-ті үйрету үшін қандай ақпарат түрі қолданылады?
Жалпыға қолжетімді интернет мазмұны бойынша біз тек интернетте еркін әрі ашық қолжетімді ақпаратты пайдаланамыз. Бұған жалпыға қолжетімді веб-беттер, ашық форумдар, ашық блогтар, жария жазбалар және басқа да жалпыға қолжетімді онлайн мазмұн кіруі мүмкін. Мысалы, егер сіз жалпыға қолжетімді онлайн талқылау форумына қатыссаңыз немесе ашық блог не басқа жария жазба орналастырсаңыз, біз сол жалпыға қолжетімді мазмұнды модельді үйрету мақсатында пайдалануымыз мүмкін. Дегенмен үйрету процесінде жеке ақпаратты өңдеуді азайту үшін шаралар қолданамыз. Жалпыға қолжетімді интернет мазмұнын жинағанда, біз ақылы қабырға артында екені белгілі дереккөздерден немесе дарк вебтен деректерді әдейі жинамаймыз. Сонымен қатар модельдеріміздің үйренуін қаламайтын материалдарды, мысалы өшпенділік сөзін, ересектерге арналған мазмұнды, жеке ақпаратты жинақтайтын сайттарды және спамды алып тастау үшін сүзгілер қолданамыз. Қалған ақпарат кейін модельдерімізді үйрету үшін пайдаланылады.
Веб-сайт иелері өз сайттарындағы жалпыға қолжетімді мазмұнның үйретуде қолдану үшін қолжетімді болуын стандартты веб-басқару құралдары арқылы басқара алады, мысалы robots.txt көмегімен GPTBot-қа тыйым сала алады; ол модельдерімізді үйретуге көмектесу үшін жалпыға қолжетімді мазмұнды тексере алады. Веб-сайт иелеріне сайттары мен мазмұнының біздің AI жүйелерімізбен қалай өзара әрекеттесетінін басқаруға көмектесу үшін нұсқаулық ұсынамыз.
Модельдерімізді үйретуге және жақсартуға көмектесу үшін үшінші тарап серіктестерден алынған ақпаратты да пайдаланамыз. Бұған үшінші тараптармен жасалған келісімдер арқылы қол жеткізетін деректер жиындарындағы ақпарат, сондай-ақ саясаттарымыз бен келісімдеріміз рұқсат еткен жағдайда адам жаттықтырушылар мен зерттеушілер ұсынған немесе жасаған ақпарат кіруі мүмкін. Бұл модельдеріміздің сапасын, қауіпсіздігін және өнімділігін жақсартуға көмектеседі. Деректер жиынына қарай бұл көздер мәтін, кескін, аудио, бейне немесе басқа дерек түрлерін қамтуы мүмкін.
Кейбір үйрету процестерінде синтетикалық деректерді де барған сайын көбірек қолданамыз. Мысалы, синтетикалық көмексөздер, көптілді мысалдар немесе басқа үйрету материалдарын жасау үшін ақпарат пен модельдерімізді пайдалануымыз мүмкін. Синтетикалық деректер дерек аз немесе теңгерімсіз салаларда үйрету деректерін толықтыру арқылы модель өнімділігін жақсартуға көмектеседі және модель әзірлеуде жекелікті күшейтетін тәсілдерді де қолдауы мүмкін.
ChatGPT-ті үйрету үшін жеке ақпарат қолданыла ма?
Онлайн мазмұнның елеулі бөлігі адамдар туралы ақпаратты қамтиды, сондықтан үйрету деректерімізге жеке ақпарат кездейсоқ енуі мүмкін. Дегенмен үйрету процесінде жеке ақпаратты өңдеуді азайту үшін шаралар қолданамыз.
Біз үйрету деректерін жеке тұлғалардың профильдерін жасау, олармен байланысу немесе оларға жарнаманы жекелендіру үшін емес, модельдің болжау, ой қорыту және мәселе шешу сияқты қабілеттерін дамыту үшін пайдаланамыз.
Кейбір жағдайларда модельдер есімдер мен мекенжайлар сияқты элементтердің тілде қалай қызмет ететінін түсіну немесе қоғамға белгілі тұлғалар мен кеңінен танылған нысандарды тану үшін жеке ақпараттан үйренуі мүмкін. Бұл модельге дәлірек және контекске сай жауаптар жасауға көмектеседі.
Үйрету кезінде жеке ақпарат қалай қорғалады?
Үйрету кезінде жеке ақпаратты өңдеуді шектеу үшін белсенді шаралар қолданамыз. Мысалы, жеке деректердің үлкен көлемін жинақтайтыны белгілі дереккөздерді алып тастаймыз, үйрету процесінде жеке ақпаратты азайту үшін сүзгілеу қолданамыз және үйрету деректерінің қайталану қаупін төмендету үшін қайталанатын мазмұнды анықтап, жою шараларын қабылдаймыз. Сонымен қатар модельдерімізді жеке адамдар туралы құпия немесе сезімтал ақпарат сұрауларына жауап бермеуге үйретеміз.
Ақпаратты қанша уақыт сақтаймыз
Үйрету деректеріндегі ақпаратты осы мақалада және Жекелік саясатымызда сипатталған мақсаттар үшін, соның ішінде модельдерімізді әзірлеу және жақсарту әрі соған байланысты ғылыми зерттеу мақсаттары үшін ақылға қонымды қажет мерзімде ғана сақтаймыз. Сақтау қажеттілігі жалғасып отырғанын қамтамасыз ету үшін мерзімді түрде қайта қаралады және ақпарат түріне әрі оның қалай пайдаланылатынына қарай өзгереді. Сақтау мерзімін айқындағанда ақпаратты өңдеу мақсатымыз, ақпараттың көлемі, сипаты мен сезімталдығы, рұқсатсыз пайдалану немесе жария ету салдарынан келуі мүмкін зиян қаупі және бізге қолданылатын кез келген заңды міндеттемелер сияқты факторларды ескереміз.
ChatGPT әзірленуі жекелік туралы заңдарға қалай сай келеді?
Біз үйрету ақпаратын заңды түрде пайдаланамыз. Біздің іргелі модельдеріміз қолжетімділік құралдары, тұтынушыларды қолдау, бағдарламалық жасақтама әзірлеу, жекелендірілген білім беру және ғылыми зерттеу сияқты көптеген пайдалы қолданбаларды қуаттайды. Бұл қабілеттер ауқымды дайындық деректеріне, соның ішінде жалпыға қолжетімді ақпаратқа және үшінші тарап серіктестерден алынған ақпаратқа тәуелді. Осы мақалада сипатталғандай, үйрету процесі бойы жеке ақпаратты өңдеуді азайтуға және тәуекелдерді жеңілдетуге арналған қадамдарды қоса алғанда, қорғау шараларын қолданамыз. Үйрету ақпаратына кіретін жеке ақпаратты жинауымыз бен пайдалануымызды GDPR сияқты жекелік туралы заңдардағы заңды мүдделерге негіздейміз; бұған жалпы жасанды интеллект баршаға пайда әкелуін қамтамасыз ету миссиямызға сай пайдаланушылар мен кең қоғам үшін модельдерімізді үйрету және жақсарту кіреді, бұл Жекелік саясатымызда толығырақ түсіндірілген. Бұл ақпаратты заңды әрі жауапты түрде жинап, пайдаланып жатқанымызды қамтамасыз етуге көмектесу үшін деректерді қорғауға әсерді бағалауды аяқтадық.
Ақпарат қашан бөлісілуі немесе берілуі мүмкін
Біз жеке ақпаратты «сатпаймыз» және үйрету деректеріндегі жеке ақпаратты тек Жекелік саясатымызда сипатталған шектеулі жағдайларда ғана жария етеміз. Мысалы, модельдерімізді әзірлеуді, сынауды және жақсартуды қолдайтын үлестес ұйымдармен, жеткізушілермен және қызмет көрсетушілермен ақпарат бөлісуіміз мүмкін. Сондай-ақ заңды міндеттемені орындау немесе өз құқықтарымызды, қауіпсіздігіміз бен қорғалуымызды және пайдаланушыларымыздың, қызметкерлеріміздің немесе жұртшылықтың құқықтарын, қауіпсіздігі мен қорғалуын қорғау үшін мұндай әрекет қажет деп адал ниетпен сенсек, ақпаратты жария етуіміз мүмкін; бұл Жекелік саясатымызда сипатталған.
Инфрақұрылымымыз жаһандық болғандықтан, үйрету деректеріндегі жеке ақпарат ЕЭА, Швейцария немесе Ұлыбританиядан тыс елдерде (соның ішінде Америка Құрама Штаттарында) өңделуі мүмкін. Мұндай жағдайда, Жекелік саясатымызда сипатталғандай, сәйкестік туралы шешімдер немесе стандартты шарттық ережелер сияқты тиісті қорғау шараларын қолданамыз.
Құқықтарыңыз және оларды қалай жүзеге асыруға болады
Біз қарсылық білдіру сұрауларына және ұқсас құқық сұрауларына жауап береміз. Тілді үйренудің нәтижесінде ChatGPT жауаптары кейде жеке ақпараты ашық интернетте бірнеше рет кездесетін адамдар туралы жеке ақпаратты қамтуы мүмкін (мысалы, қоғамға белгілі тұлғалар). Кейбір юрисдикциялардағы жеке тұлғалар модельдеріміздің өздерінің жеке ақпаратын өңдеуіне қарсылық білдіре алады немесе Жекелік порталы арқылы деректер субъектісінің басқа құқықтары бойынша сұраулар жібере алады. Сондай-ақ бұл құқықтарды privacy@openai.com мекенжайына хабарласу арқылы жүзеге асыра аласыз.
Сұрауыңызды бағалап, жауап беруімізге көмектесу үшін оның қандай жеке ақпаратқа қатысты екенін түсінуімізге жеткілікті мәлімет беріңіз, мысалы атыңыз, қатысты URL мекенжайлары, модель шығарған нәтижелердің нақты мысалдары немесе мәселені анықтауға көмектесетін басқа деректер. Кейбір жағдайларда әрекет ете алуымыз үшін жеке басыңызды растауды немесе ақпараттың сізге қатысты екенін растауды сұрауымыз мүмкін. Бұл сұрауларды қалай жіберу керегі, соның ішінде үздік тәжірибелер және сұраулардың қалай қаралатыны туралы қосымша ақпарат ChatGPT-тен жеке деректерді жою жөніндегі Көмек көрсету орталығы мақаласында қолжетімді. Біз сұрауларды қолданылатын жекелік туралы заңдарға сәйкес қарап, тиісті заңды мерзімдер ішінде жауап береміз.
Жекелік туралы заңдарға сәйкес, кейбір құқықтар абсолютті болмауы мүмкін екенін ескеріңіз. Мысалы, тиісті ақпаратты тексере алмасақ, сұрау OpenAI өңдейтін жеке ақпаратқа қатысты болмаса, ерекше жағдай қолданылса немесе бұлай істеуге басқа заңды негізіміз болса, сұрауды орындай алмауымыз мүмкін. Сұраулар әр жағдай бойынша жеке бағаланады және жекелік құқықтарын сөз бостандығы мен қоғамдық мүдде сияқты басқа маңызды пайымдармен теңестіруді қамтуы мүмкін.
Дегенмен біз жеке ақпаратты қорғауға басымдық беруге тырысамыз және қолданылатын барлық жекелік туралы заңдарды сақтаймыз. Егер мәселені жеткілікті түрде шешпедік деп есептесеңіз, жергілікті қадағалау органына шағым беруге құқығыңыз бар.
Веб-сайтымызды, қолданбаларымызды және қызметтерімізді пайдаланған кезде сізден немесе сіз туралы жинайтын жеке ақпаратқа қатысты OpenAI тәжірибелері туралы қосымша ақпарат алу үшін Жекелік саясатымызды қараңыз.
