OpenAI
Оваа страница беше машински преведена. Погледнете ја оригиналната статија на англиски јазик.

Како се развиваат ChatGPT и нашите основни модели

Дознајте повеќе за тоа како ги развиваме нашите модели и ги применуваме во производи како ChatGPT

Ажурирано: 15 days ago

Основните модели на OpenAI, вклучувајќи ги и моделите што го овозможуваат ChatGPT, се развиваат со користење три главни извори на информации: (1) информации што се јавно достапни на интернет, (2) информации до кои пристапуваме во соработка со трети страни и (3) информации што ги обезбедуваат или создаваат нашите корисници, обучувачи и истражувачи.

Развивањето основни модели како оние што се користат во ChatGPT опфаќа неколку фази, меѓу кои подготовка на податоците за обука, претходно обучување и дополнително обучување, како и постојано оценување и подобрување по нивното пуштање во употреба. Во овие фази може да се користат различни видови информации за разни цели, меѓу кои подобрување на перформансите, сигурноста и безбедноста на моделот. 

Оваа статија дава преглед на информациите што ги користиме за да помогнеме во развојот на овие модели, начинот на кој ги собираме и користиме во согласност со законите за приватност и заштитните мерки што ги применуваме во текот на целиот процес на обука. За да дознаете како собираме и користиме информации од корисниците на нашите услуги, вклучувајќи и како да го исклучите користењето на разговорите во ChatGPT за подобрување на нашите модели, погледнете ги нашата Политика на приватност и оваа статија во Центарот за помош.

Што е ChatGPT и како функционира?

ChatGPT е услуга заснована на вештачка интелигенција до која може да пристапите преку интернет или апликација. ChatGPT може да го користите за широк спектар задачи, меѓу кои организирање и резимирање информации, помош при преведување, програмирање, истражување и анализа, извршување задачи во повеќе чекори со различни алатки, анализирање или создавање слики, поттикнување креативност и идеи, како и за други секојдневни активности. ChatGPT е осмислен да ги разбира прашањата и упатствата на корисниците и да одговара на нив така што учи обрасци од големо количество информации, вклучувајќи текст, слики, аудио и видео. 

За време на обуката, моделот ги анализира односите во овие податоци — на пример, како зборовите обично се појавуваат заедно во одреден контекст — и го користи тоа разбирање за при создавањето одговор, збор по збор, да го предвиди следниот најверојатен збор. Текстот може да се претвори во помали единици, понекогаш наречени „токени“, кои може да претставуваат цели зборови, делови од зборови или интерпункциски знаци. Токените се основните градбени единици на текстот што го обработува моделот. Слично на тоа, моделите што создаваат други видови содржина, како слики, учат обрасци во односите меѓу пикселите и нивната поврзаност со соодветните описи во податоците за обука.

На пример, во текот на процесот на учење на моделот (познат како „обука“), моделот може да добие задача да дополни реченица како: „Наместо да сврти лево, таа сврте ___.“ Во почетокот на обуката, неговите одговори се главно случајни. Меѓутоа, додека моделот обработува и учи од големо количество текст, тој станува подобар во препознавањето обрасци и предвидувањето на следниот најверојатен збор. Овој процес се повторува со милиони реченици за да се усовршат неговото разбирање и точноста.

Бидејќи една реченица може веродостојно да се дополни на повеќе начини — на пример, „Наместо да сврти лево, таа сврте десно“, „наоколу“ или „назад“ — во одговорите на моделот неизбежно постои одреден степен на случајност. Затоа, истото прашање може да даде различни одговори при различни пребарувања.

Моделите за машинско учење се состојат од големи множества броеви, познати како „тежини“ или „параметри“, како и код што ги толкува и користи тие броеви. Овие модели не чуваат копии од податоците врз кои се обучени. Наместо тоа, додека моделот учи, вредностите на неговите параметри малку се приспособуваат за да ги одразат обрасците што ги препознал. Во претходниот пример, моделот напредуваше од предвидување случајни зборови до попрецизни предвидувања — не со зачувување на речениците за обука, туку со ажурирање на своите внатрешни параметри. Моделот не чува копии од речениците, сликите или аудиосодржините што ги обработува за време на обуката. ChatGPT не „копира и залепува“ од податоците за обука — слично како наставник кој, по темелно изучување, може да објаснува поими така што ги разбира односите меѓу идеите, без да ги учи напамет или дословно да ги повторува изворните материјали. Кога создава одговор на барање од корисник, моделот ги користи овие научени тежини за да предвиди и создаде нова содржина.

Какви информации се користат за обучување на ChatGPT?

Од јавно достапната интернет-содржина користиме само информации што се слободно и отворено достапни на интернет. Тоа може да опфаќа јавно достапни веб-страници, јавни форуми, јавни блогови и објави, како и друга јавно достапна онлајн содржина. На пример, ако учествувате во јавно достапен онлајн-форум за дискусија или објавите јавен блог или друга јавна објава, може да ја користиме таа јавно достапна содржина за обука на моделот. Сепак, преземаме мерки за да ја намалиме обработката на лични информации во процесот на обука.  Кога собираме јавно достапна интернет-содржина, намерно не собираме податоци од извори за кои се знае дека се зад наплатен ѕид или на темната мрежа. Дополнително, применуваме филтри за да ги отстраниме материјалите од кои не сакаме нашите модели да учат, како говор на омраза, содржина за возрасни, веб-локации што собираат лични информации и спам. Преостанатите информации потоа се користат за обука на нашите модели. 

Сопствениците на веб-локации можат да одредат дали јавно достапната содржина од нивните локации смее да се користи за обука, применувајќи стандардни веб-контроли како robots.txt за да го блокираат GPTBot, кој може да ја пребарува јавно достапната содржина за да помогне во обуката на нашите модели. Нудиме насоки што им помагаат на сопствениците на веб-локации да управуваат со начинот на кој нивните локации и содржини комуницираат со нашите системи за вештачка интелигенција. 

Користиме и информации од партнери што се трети страни за да помогнеме во обуката и подобрувањето на нашите модели. Тоа може да опфаќа информации во збирки податоци до кои пристапуваме врз основа на договори со трети страни, како и информации што ги обезбедуваат или создаваат обучувачи и истражувачи кога тоа е дозволено со нашите политики и договори. Ова помага да се подобрат квалитетот, безбедноста и перформансите на нашите модели. Во зависност од збирката податоци, овие извори може да содржат текст, слики, аудио, видео или други видови податоци.

Во некои процеси на обука сè повеќе користиме и синтетички податоци. На пример, може да користиме информации и наши модели за да создаваме синтетички упатства, повеќејазични примери или други материјали за обука. Синтетичките податоци може да помогнат во подобрувањето на перформансите на моделот, меѓу другото со дополнување на податоците за обука во области каде што тие се оскудни или неурамнотежени, а може да поддржат и пристапи кон развојот на моделите што ја унапредуваат приватноста.

Дали за обучување на ChatGPT се користат лични информации?

Значителен дел од онлајн-содржината вклучува информации за луѓе, па нашите податоци за обука може случајно да содржат лични информации. Сепак, преземаме мерки за да ја намалиме обработката на лични информации во процесот на обука.

Податоците за обука ги користиме за да ги развиеме способностите на моделот — како предвидување, расудување и решавање проблеми — а не за да создаваме профили на поединци, да контактираме со нив или да им приспособуваме реклами.

Во некои случаи, моделите може да учат од лични информации за да разберат како елементите како имиња и адреси функционираат во јазикот или за да препознаваат јавни личности и добро познати субјекти. Ова му помага на моделот да создава попрецизни одговори што се соодветни на контекстот.

Како се заштитуваат личните информации за време на обуката?

Преземаме активни мерки за да ја ограничиме обработката на лични информации за време на обуката. На пример, исклучуваме познати извори што собираат големи количества лични податоци, применуваме филтрирање за да го намалиме присуството на лични информации во процесот на обука и преземаме мерки за откривање и отстранување дупликати за да го намалиме ризикот од повторување на податоците за обука. Дополнително, ги обучуваме нашите модели да избегнуваат да одговараат на барања за приватни или чувствителни информации за поединци. 

Колку долго ги чуваме информациите

Информациите во податоците за обука ги чуваме само онолку долго колку што е разумно потребно за целите опишани во оваа статија и во нашата Политика на приватност, вклучително и за развивање и подобрување на нашите модели и за поврзани научноистражувачки цели. Потребата од чување периодично се преиспитува за да се утврди дали и понатаму постои, а периодот на чување зависи од видот на информациите и начинот на нивното користење. При одредувањето на периодот на чување ги земаме предвид факторите како целта за која ги обработуваме информациите, нивното количество, природа и чувствителност, можниот ризик од штета поради неовластено користење или откривање и сите законски обврски што важат за нас.

Како развојот на ChatGPT е усогласен со законите за приватност?

Информациите за обука ги користиме законски. Нашите основни модели овозможуваат широк спектар корисни примени — меѓу кои алатки за пристапност, корисничка поддршка, развој на софтвер, персонализирано образование и научни истражувања. Овие способности зависат од податоци за обука од голем обем, вклучувајќи јавно достапни информации и информации од партнери што се трети страни. Во текот на целиот процес на обука применуваме заштитни мерки, вклучувајќи чекори осмислени да ја намалат обработката на лични информации и да ги ублажат ризиците, како што е опишано во оваа статија. Собирањето и користењето лични информации што се вклучени во информациите за обука ги засноваме на легитимни интереси според законите за приватност како GDPR, вклучително и за обука и подобрување на нашите модели во корист на корисниците и поширокото општество, во согласност со нашата мисија општата вештачка интелигенција да им користи на сите, како што е подетално објаснето во нашата Политика на приватност. Извршивме процена на влијанието врз заштитата на податоците за да помогнеме да се осигуриме дека ги собираме и користиме овие информации законски и одговорно.

Кога информациите може да се споделат или пренесат

Ние не „продаваме“ лични информации и ги откриваме личните информации во податоците за обука само во ограничените околности опишани во нашата Политика на приватност. На пример, може да споделуваме информации со поврзани друштва, добавувачи и даватели на услуги што го поддржуваат развојот, тестирањето и подобрувањето на нашите модели. Може да откриеме информации и кога со добра намера веруваме дека тоа е неопходно за исполнување законска обврска или за заштита на нашите права и нашата сигурност и безбедност, како и оние на нашите корисници, вработени или јавноста, како што е опишано во нашата Политика на приватност.

Бидејќи нашата инфраструктура е глобална, личните информации во податоците за обука може да се обработуваат во земји надвор од ЕЕП, Швајцарија или Обединетото Кралство (вклучително и во Соединетите Американски Држави). Кога се случува тоа, применуваме соодветни заштитни мерки, како одлуки за соодветност или стандардни договорни клаузули, како што е опишано во нашата Политика на приватност.

Вашите права и како да ги остварите

Одговараме на приговори и слични барања за остварување права. Како резултат на учењето на јазикот, одговорите на ChatGPT понекогаш може да содржат лични информации за поединци чии лични информации се појавуваат повеќепати на јавниот интернет (на пример, јавни личности). Поединците во одредени јурисдикции можат да поднесат приговор на обработката на нивните лични информации од нашите модели или да поднесат други барања за остварување на правата на субјектите на податоци преку нашиот Портал за приватност. Овие права може да ги остварите и ако пишете на privacy@openai.com.

За да ни помогнете да го процениме вашето барање и да одговориме на него, наведете доволно информации за да разбереме на кои лични информации се однесува, како вашето име, релевантни URL-адреси, конкретни примери од резултатите на моделот или други детали што помагаат да се утврди проблемот. Во некои случаи, може да побараме да го потврдите вашиот идентитет или дека информациите се однесуваат на вас пред да преземеме дејство. Повеќе информации за поднесувањето на овие барања, вклучувајќи ги најдобрите практики и начинот на нивното разгледување, се достапни во нашата статија во Центарот за помош за отстранување лични податоци од ChatGPT. Барањата ги разгледуваме во согласност со важечките закони за приватност и одговараме во важечките законски рокови.

Имајте предвид дека, во согласност со законите за приватност, некои права може да не бидат апсолутни. На пример, можеби нема да можеме да исполниме барање ако не можеме да ги потврдиме релевантните информации, ако барањето не се однесува на лични информации што ги обработува OpenAI, ако важи исклучок или ако имаме друга законска причина да не го сториме тоа. Барањата се проценуваат поединечно и може да вклучуваат урамнотежување на правата на приватност со други важни аспекти, како слободата на изразување и јавниот интерес.

Сепак, настојуваме да ѝ дадеме приоритет на заштитата на личните информации и да ги почитуваме сите важечки закони за приватност. Ако сметате дека не сме решиле некое прашање на соодветен начин, имате право да поднесете жалба до вашиот локален надзорен орган.

За повеќе информации за практиките на OpenAI во врска со личните информации што ги собираме од вас или за вас кога ги користите нашите веб-локации, апликации и услуги, погледнете ја нашата Политика на приватност.

Дали оваа статија ви беше корисна?