OpenAI
Бұл бет машиналық аударма арқылы жасалған. Түпнұсқа ағылшын мақаласын қараңыз.

ChatGPT пен біздің базалық модельдеріміз қалай әзірленеді

Модельдерімізді қалай әзірлеп, оларды ChatGPT сияқты өнімдерде қалай қолданатынымыз туралы толығырақ біліңіз

Жаңартылған: 15 days ago

OpenAI компаниясының іргелі модельдері, соның ішінде ChatGPT негізінде жұмыс істейтін модельдер, үш негізгі ақпарат көзі арқылы әзірленеді: (1) интернетте жалпыға қолжетімді ақпарат, (2) үшінші тараптармен серіктестік негізінде қол жеткізетін ақпарат және (3) пайдаланушыларымыз, маман-нұсқаушыларымыз бен зерттеушілеріміз ұсынатын немесе жасайтын ақпарат.

ChatGPT жүйесінде қолданылатын іргелі модельдерді әзірлеу бірнеше кезеңнен тұрады. Оларға үйрету деректерін дайындау, алдын ала үйрету және кейінгі үйрету, сондай-ақ қолданысқа енгізілгеннен кейін үздіксіз бағалау мен жетілдіру жатады. Бұл кезеңдерде әртүрлі мақсатпен, соның ішінде модельдің өнімділігін, сенімділігі мен қауіпсіздігін арттыру үшін әртүрлі ақпарат қолданылуы мүмкін. 

Бұл мақалада осы модельдерді әзірлеуге көмектесу үшін қандай ақпаратты қолданатынымыз, оны жекелік туралы заңдарға сай қалай жинап, пайдаланатынымыз және бүкіл үйрету процесінде қандай қорғаныс шараларын қолданатынымыз баяндалады. Қызметтеріміздің пайдаланушыларынан ақпаратты қалай жинап, қолданатынымызды, соның ішінде ChatGPT сұхбаттарының модельдерімізді жетілдіруге пайдаланылуынан қалай бас тартуға болатынын білу үшін Жекелік саясатымызды және Көмек көрсету орталығындағы осы мақаланы қараңыз.

ChatGPT деген не және ол қалай жұмыс істейді?

ChatGPT — интернет немесе қолданба арқылы пайдалануға болатын жасанды интеллект негізіндегі қызмет. ChatGPT қолданбасын ақпаратты реттеу мен қорытындылау, аудармаға көмектесу, бағдарламалау, зерттеу және талдау, әртүрлі құралдар арқылы бірнеше кезеңді тапсырмаларды орындау, кескіндерді талдау немесе жасау, шығармашылық пен жаңа идеяларға шабыт беру және басқа да күнделікті жұмыстар үшін пайдалана аласыз. ChatGPT мәтін, кескін, аудио және бейне секілді ауқымды ақпараттағы заңдылықтарды үйрену арқылы пайдаланушылардың сұрақтары мен нұсқауларын түсініп, оларға жауап беруге арналған. 

Үйрету кезінде модель осы деректердегі байланыстарды, мысалы, сөздердің белгілі бір мәнмәтінде әдетте қалай қатар қолданылатынын талдайды. Содан кейін осы түсінігін пайдаланып, жауап құрастырғанда ең ықтимал келесі сөзді бір-бірлеп болжайды. Мәтін тұтас сөздерді, сөз бөліктерін немесе тыныс белгілерін білдіруі мүмкін әрі кейде «токендер» деп аталатын шағын бірліктерге бөлінуі мүмкін. Токендер — модель өңдейтін мәтіннің құрылымдық бөліктері. Сол сияқты, кескін секілді басқа мазмұн түрлерін жасайтын модельдер үйрету деректеріндегі пиксельдердің бір-бірімен және оларға қатысты сипаттамалармен байланысу заңдылықтарын үйренеді.

Мысалы, модельді үйрету кезінде оған «Ол солға бұрылмай, ___ бұрылды» деген сөйлемді аяқтау тапсырылуы мүмкін. Үйретудің бастапқы кезеңінде оның жауаптары көбіне кездейсоқ болады. Алайда модель мәтіннің үлкен көлемін өңдеп, одан үйренген сайын заңдылықтарды жақсырақ танып, ең ықтимал келесі сөзді дәлірек болжай бастайды. Оның түсінігін тереңдетіп, дәлдігін арттыру үшін бұл процесс миллиондаған сөйлемде қайталанады.

Сөйлемді бірнеше қисынды жолмен, мысалы, «Ол солға бұрылмай, оңға бұрылды», «кері бұрылды» немесе «артқа бұрылды» деп аяқтауға болатындықтан, модель жауаптарында кездейсоқтық элементі болады. Сондықтан бір сұрақ әр сұраған сайын әртүрлі жауап беруі мүмкін.

Машиналық оқыту модельдері «салмақтар» немесе «параметрлер» деп аталатын сандардың үлкен жиынтығынан және сол сандарды түсіндіріп, қолданатын кодтан тұрады. Бұл модельдер үйретілген деректердің көшірмелерін сақтамайды. Оның орнына модель үйренген сайын өзі анықтаған заңдылықтарды көрсету үшін параметрлерінің мәндері аздап өзгертіледі. Алдыңғы мысалда модель үйрету сөйлемдерін сақтаудың емес, ішкі параметрлерін жаңартудың арқасында кездейсоқ сөздерді болжаудан дәлірек болжауға көшті. Модель үйрету кезінде өңдейтін сөйлемдердің, кескіндердің немесе аудионың көшірмелерін сақтамайды. ChatGPT үйрету деректерін «көшіріп қоймайды». Бұл көп ізденген мұғалімнің бастапқы материалдарды сөзбе-сөз жаттамай не қайталамай-ақ, идеялар арасындағы байланысты түсіну арқылы ұғымдарды түсіндіруіне ұқсайды. Пайдаланушы сұрауына жауап жасағанда, модель осы үйренген салмақтарды жаңа мазмұнды болжап, құрастыру үшін қолданады.

ChatGPT жүйесін үйрету үшін қандай ақпарат қолданылады?

Интернеттегі жалпыға қолжетімді мазмұннан тек еркін әрі ашық қолжетімді ақпаратты пайдаланамыз. Оған жалпыға қолжетімді веб-беттер, ашық форумдар, блогтар мен жарияланымдар және басқа да жалпыға қолжетімді онлайн мазмұн кіруі мүмкін. Мысалы, жалпыға қолжетімді онлайн форумдағы талқылауға қатыссаңыз немесе ашық блогта не басқа жерде жарияланым жасасаңыз, сол жалпыға қолжетімді мазмұнды модельді үйрету мақсатында пайдалануымыз мүмкін. Дегенмен үйрету процесінде жеке ақпараттың өңделуін азайту шараларын қолданамыз.  Интернеттегі жалпыға қолжетімді мазмұнды жинағанда, ақылы қолжетімділікпен шектелгені белгілі дереккөздерден немесе даркнеттен деректерді әдейі жинамаймыз. Сондай-ақ модельдеріміз үйренбеуі тиіс материалдарды, мысалы, өшпенділік сөздерін, ересектерге арналған мазмұнды, жеке ақпаратты біріктіріп жинайтын сайттарды және спамды жою үшін сүзгілер қолданамыз. Содан кейін қалған ақпарат модельдерімізді үйретуге пайдаланылады. 

Веб-сайт иелері стандартты веб-басқару құралдарын, мысалы, robots.txt файлын пайдаланып, GPTBot қызметіне тыйым салу арқылы сайттарындағы жалпыға қолжетімді мазмұнның үйрету мақсатында пайдаланылуына жол бермеуді басқара алады. GPTBot модельдерімізді үйретуге көмектесу үшін жалпыға қолжетімді мазмұнды қарап шығуы мүмкін. Веб-сайт иелеріне сайттары мен мазмұнының ЖИ жүйелерімізбен өзара әрекетін басқаруға көмектесетін нұсқаулық ұсынамыз. 

Модельдерімізді үйретіп, жетілдіруге көмектесу үшін үшінші тарап серіктестерінің ақпаратын да пайдаланамыз. Оған үшінші тараптармен жасалған келісімдер арқылы қол жеткізетін деректер жиынтығындағы ақпарат, сондай-ақ саясаттарымыз бен келісімдеріміз рұқсат еткен жағдайда маман-нұсқаушылар мен зерттеушілер ұсынған немесе жасаған ақпарат кіруі мүмкін. Бұл модельдеріміздің сапасын, қауіпсіздігі мен өнімділігін арттыруға көмектеседі. Деректер жиынтығына қарай бұл дереккөздерде мәтін, кескін, аудио, бейне немесе басқа дерек түрлері болуы мүмкін.

Кейбір үйрету процестерінде синтетикалық деректерді де барған сайын көбірек пайдаланамыз. Мысалы, синтетикалық нұсқауларды, көптілді мысалдарды немесе басқа үйрету материалдарын жасау үшін ақпарат пен модельдерімізді пайдалануымыз мүмкін. Синтетикалық деректер сирек немесе теңгерімсіз салалардағы үйрету деректерін толықтыру арқылы модель өнімділігін арттыруға көмектеседі. Сондай-ақ олар модельдерді әзірлеудегі жекелікті күшейтетін тәсілдерді қолдауы мүмкін.

ChatGPT жүйесін үйрету үшін жеке ақпарат қолданыла ма?

Интернеттегі мазмұнның едәуір бөлігі адамдар туралы ақпаратты қамтиды, сондықтан үйрету деректерімізге жеке ақпарат байқаусызда енуі мүмкін. Дегенмен үйрету процесінде жеке ақпараттың өңделуін азайту шараларын қолданамыз.

Үйрету деректерін жеке тұлғалардың профильдерін жасау, олармен байланысу немесе оларға жарнаманы бейімдеу үшін емес, модельдің болжау, ой қорыту және мәселе шешу секілді мүмкіндіктерін дамыту үшін пайдаланамыз.

Кейбір жағдайларда модельдер есімдер мен мекенжайлар секілді элементтердің тілде қалай қолданылатынын түсіну немесе қоғам қайраткерлері мен танымал ұйымдарды тану үшін жеке ақпараттан үйренуі мүмкін. Бұл модельге дәлірек әрі мәнмәтінге сай жауаптар жасауға көмектеседі.

Үйрету кезінде жеке ақпарат қалай қорғалады?

Үйрету кезінде жеке ақпараттың өңделуін шектеу үшін белсенді шаралар қолданамыз. Мысалы, жеке деректердің үлкен көлемін біріктіріп жинайтыны белгілі дереккөздерді алып тастаймыз, үйрету процесіндегі жеке ақпаратты азайту үшін сүзгілер қолданамыз және үйрету деректерінің қайталану қаупін төмендету үшін қайталанатын мазмұнды анықтап, жою шараларын қабылдаймыз. Сонымен қатар модельдерімізді жеке тұлғалар туралы құпия немесе сезімтал ақпаратты сұраған өтініштерге жауап бермеуге үйретеміз. 

Ақпаратты қанша уақыт сақтаймыз

Үйрету деректеріндегі ақпаратты осы мақалада және Жекелік саясатымызда сипатталған мақсаттарға, соның ішінде модельдерімізді әзірлеу мен жетілдіруге және тиісті ғылыми зерттеулерге қажет ақылға қонымды мерзім ішінде ғана сақтаймыз. Ақпаратты сақтау қажеттілігі жүйелі түрде қайта қаралады, ал сақтау мерзімі ақпараттың түрі мен қолданылуына қарай өзгереді. Сақтау мерзімін анықтағанда ақпаратты өңдеу мақсатымызды, оның көлемін, сипаты мен сезімталдығын, рұқсатсыз пайдалану немесе жариялау салдарынан келуі ықтимал зиян қаупін және бізге қолданылатын заңды міндеттемелерді ескереміз.

ChatGPT әзірлеу процесі жекелік туралы заңдарға қалай сай келеді?

Үйрету ақпаратын заңға сай пайдаланамыз. Іргелі модельдеріміз арнайы мүмкіндіктер құралдары, тұтынушыларды қолдау, бағдарламалық жасақтама әзірлеу, жекелендірілген білім беру және ғылыми зерттеулер секілді көптеген пайдалы қолданбаның жұмысын қамтамасыз етеді. Бұл мүмкіндіктер жалпыға қолжетімді ақпарат пен үшінші тарап серіктестерінің ақпаратын қоса алғанда, ауқымды үйрету деректеріне тәуелді. Осы мақалада сипатталғандай, бүкіл үйрету процесінде қорғаныс шараларын, соның ішінде жеке ақпараттың өңделуін азайтуға және қауіптерді төмендетуге арналған қадамдарды қолданамыз. Үйрету ақпаратына кіретін жеке ақпаратты жинауымыз бен пайдалануымыз GDPR секілді жекелік туралы заңдарда көзделген заңды мүдделерге негізделеді. Бұған жалпы жасанды интеллект баршаға пайда әкелуін қамтамасыз ету жөніндегі миссиямызға сай модельдерімізді пайдаланушылар мен жалпы қоғам үшін үйрету және жетілдіру кіреді. Бұл туралы Жекелік саясатымызда толығырақ түсіндірілген. Бұл ақпаратты заңды әрі жауапкершілікпен жинап, пайдаланып жатқанымызды қамтамасыз ету үшін деректерді қорғауға әсерін бағалауды аяқтадық.

Ақпарат қандай жағдайда бөлісілуі немесе берілуі мүмкін

Біз жеке ақпаратты «сатпаймыз» және үйрету деректеріндегі жеке ақпаратты Жекелік саясатымызда сипатталған шектеулі жағдайларда ғана жария етеміз. Мысалы, ақпаратты модельдерімізді әзірлеуге, сынауға және жетілдіруге қолдау көрсететін үлестес ұйымдармен, жеткізушілермен және қызмет көрсетушілермен бөлісуіміз мүмкін. Сондай-ақ Жекелік саясатымызда сипатталғандай, заңды міндеттемені орындау немесе өзіміздің, пайдаланушыларымыздың, қызметкерлеріміздің не қоғамның құқықтарын, амандығы мен қауіпсіздігін қорғау үшін қажет деп адал ниетпен есептесек, ақпаратты жария етуіміз мүмкін.

Инфрақұрылымымыз жаһандық болғандықтан, үйрету деректеріндегі жеке ақпарат ЕЭА, Швейцария немесе Ұлыбритания аумағынан тыс елдерде, соның ішінде АҚШ-та өңделуі мүмкін. Мұндай жағдайда Жекелік саясатымызда сипатталғандай, сәйкестік туралы шешімдер немесе стандартты шарттық талаптар секілді тиісті қорғаныс шараларын қолданамыз.

Құқықтарыңыз және оларды пайдалану жолы

Біз қарсылық білдіру туралы және осыған ұқсас құқықтарды жүзеге асыру туралы сұрауларға жауап береміз. Тілді үйрену нәтижесінде ChatGPT жауаптарында жеке ақпараты ашық интернетте бірнеше рет кездесетін адамдар, мысалы, қоғам қайраткерлері туралы жеке ақпарат кейде қамтылуы мүмкін. Кейбір юрисдикциялардағы тұлғалар модельдеріміздің өз жеке ақпаратын өңдеуіне қарсылық білдіре алады немесе Жекелік порталы арқылы деректер субъектісінің басқа құқықтарына қатысты сұрау жібере алады. Бұл құқықтарды privacy@openai.com мекенжайына хабарласу арқылы да пайдалана аласыз.

Сұрауыңызды бағалап, оған жауап беруіміз үшін оның қандай жеке ақпаратқа қатысты екенін түсінуге жеткілікті мәлімет беріңіз. Мысалы, аты-жөніңізді, тиісті URL мекенжайларын, модель нәтижелерінің нақты мысалдарын немесе мәселені анықтауға көмектесетін басқа мәліметтерді ұсыныңыз. Кейбір жағдайларда әрекет етпес бұрын жеке басыңызды растауды немесе ақпараттың сізге қатысты екенін растауды сұрауымыз мүмкін. Мұндай сұрауларды жіберу тәртібі, соның ішінде озық тәжірибелер мен сұрауларды қарау жолы туралы қосымша ақпарат ChatGPT жүйесінен жеке деректерді жою жөніндегі Көмек көрсету орталығы мақаласында берілген. Сұрауларды қолданылатын жекелік туралы заңдарға сай қарап, заңда белгіленген мерзімде жауап береміз.

Жекелік туралы заңдарға сәйкес кейбір құқықтар абсолютті болмауы мүмкін екенін ескеріңіз. Мысалы, тиісті ақпаратты растай алмасақ, сұрау OpenAI өңдейтін жеке ақпаратқа қатысты болмаса, ерекшелік қолданылса немесе сұрауды орындамауға басқа заңды негізіміз болса, оны орындай алмауымыз мүмкін. Сұраулар әр жағдай бойынша жеке бағаланады. Бұл ретте жекелік құқықтары сөз бостандығы және қоғамдық мүдде секілді басқа маңызды факторлармен теңестірілуі мүмкін.

Дегенмен біз жеке ақпаратты қорғауға басымдық беруге және қолданылатын барлық жекелік туралы заңдарды сақтауға ұмтыламыз. Мәселені тиісті деңгейде шешпедік деп есептесеңіз, жергілікті қадағалау органына шағым беруге құқығыңыз бар.

Веб-сайтымызды, қолданбаларымызды және қызметтерімізді пайдаланған кезде сізден немесе сіз туралы жинайтын жеке ақпаратқа қатысты OpenAI тәжірибелері жөнінде қосымша ақпарат алу үшін Жекелік саясатымызды қараңыз.

Бұл мақала пайдалы болды ма?