OpenAI
Šo lapu tulkoja mašīntulks. Skatīt oriģinālo rakstu angļu valodā.

Kā tiek izstrādāts ChatGPT un mūsu pamata modeļi

Uzziniet vairāk par to, kā izstrādājam savus modeļus un izmantojam tos tādos produktos kā ChatGPT

Atjaunināts: 8 days ago

OpenAI pamatmodeļi, tostarp modeļi, kas nodrošina ChatGPT darbību, tiek izstrādāti, izmantojot trīs galvenos informācijas avotus: (1) internetā publiski pieejamu informāciju, (2) informāciju, kurai piekļuvi iegūstam sadarbībā ar trešajām pusēm, un (3) informāciju, ko sniedz vai ģenerē mūsu lietotāji, cilvēki apmācītāji un pētnieki.

Tādu pamatmodeļu kā ChatGPT izmantotie modeļi izstrāde ietver vairākus posmus, tostarp apmācības datu sagatavošanu, pirmsapmācību un pēcapmācību, kā arī nepārtrauktu izvērtēšanu un uzlabošanu pēc ieviešanas. Šajos posmos dažādiem mērķiem var tikt izmantoti dažādi informācijas veidi, tostarp modeļa veiktspējas, uzticamības un drošības uzlabošanai. 

Šajā rakstā sniegts pārskats par informāciju, ko izmantojam, lai palīdzētu izstrādāt šos modeļus, par to, kā šo informāciju vācam un izmantojam saskaņā ar privātuma tiesību aktiem, un par aizsardzības pasākumiem, ko piemērojam visā apmācības procesā. Lai saprastu, kā vācam un izmantojam informāciju no mūsu pakalpojumu lietotājiem, tostarp kā atteikties no ChatGPT sarunu izmantošanas mūsu modeļu uzlabošanai, lūdzu, skatiet mūsu Privātuma politiku un šo Palīdzības centra rakstu.

Kas ir ChatGPT, un kā tas darbojas?

ChatGPT ir uz mākslīgo intelektu balstīts pakalpojums, kam varat piekļūt internetā vai lietotnē. ChatGPT var izmantot plašam uzdevumu lokam, tostarp informācijas sakārtošanai un apkopošanai, tulkošanas atbalstam, programmēšanas, pētniecības un analīzes atbalstam, vairāku soļu uzdevumu veikšanai dažādos rīkos, attēlu analīzei vai ģenerēšanai, radošuma un ideju veicināšanai, kā arī citām ikdienas darbībām. ChatGPT ir izstrādāts tā, lai saprastu lietotāju jautājumus un norādījumus un atbildētu uz tiem, mācoties likumsakarības no liela informācijas apjoma, tostarp teksta, attēliem, audio un video. 

Apmācības laikā modelis analizē sakarības šajos datos, piemēram, kā vārdi parasti parādās kopā kontekstā, un izmanto šo izpratni, lai, veidojot atbildi, pa vienam vārdam prognozētu nākamo visticamāko vārdu. Tekstu var pārveidot mazākās vienībās, ko dažkārt sauc par “tekstvienībām” un kas var attēlot veselus vārdus, vārdu daļas vai pieturzīmes. Tekstvienības ir teksta pamatelementi, ko modelis apstrādā. Līdzīgi modeļi, kas ģenerē cita veida saturu, piemēram, attēlus, apgūst likumsakarības par to, kā pikseļi ir saistīti cits ar citu un ar tiem pievienotajiem parakstiem apmācības datos.

Piemēram, modeļa mācīšanās procesā (ko dēvē par “apmācību”) modelim var tikt dots uzdevums pabeigt teikumu, piemēram: “Tā vietā, lai nogrieztos pa kreisi, viņa nogriezās ___.” Apmācības sākumā tā atbildes lielākoties ir nejaušas. Tomēr, modelim apstrādājot un apgūstot lielu teksta apjomu, tas arvien labāk atpazīst likumsakarības un prognozē visticamāko nākamo vārdu. Šis process tiek atkārtots miljoniem teikumu, lai pilnveidotu modeļa izpratni un uzlabotu tā precizitāti.

Tā kā teikumu var pabeigt vairākos ticamos veidos, piemēram, “Tā vietā, lai nogrieztos pa kreisi, viņa nogriezās pa labi”, “apkārt” vai “atpakaļ”, modeļa atbildēs ir raksturīgs nejaušības elements. Tāpēc uz vienu un to pašu jautājumu dažādos vaicājumos var tikt sniegtas atšķirīgas atbildes.

Mašīnmācīšanās modeļi sastāv no lielām skaitļu kopām, ko dēvē par “svariem” vai “parametriem”, kā arī no koda, kas šos skaitļus interpretē un izmanto. Šie modeļi neuzglabā un nesaglabā to datu kopijas, uz kuriem tie ir apmācīti. Tā vietā, modelim mācoties, tā parametru vērtības tiek nedaudz pielāgotas, lai atspoguļotu identificētās likumsakarības. Iepriekšējā piemērā modelis uzlabojās no nejaušu vārdu prognozēšanas līdz precīzākām prognozēm — nevis saglabājot apmācības teikumus, bet gan atjauninot savus iekšējos parametrus. Modelis nesaglabā apmācības laikā apstrādāto teikumu, attēlu vai audio kopijas. ChatGPT “nekopē un neielīmē” no saviem apmācības datiem — līdzīgi kā skolotājs pēc plašām studijām var izskaidrot jēdzienus, izprotot sakarības starp idejām, nevis iegaumējot vai vārds vārdā atveidojot sākotnējos materiālus. Ģenerējot atbildi uz lietotāja pieprasījumu, modelis izmanto šos apgūtos svarus, lai prognozētu un radītu jaunu saturu.

Kāda veida informācija tiek izmantota ChatGPT apmācīšanai?

Attiecībā uz publiski pieejamu interneta saturu mēs izmantojam tikai informāciju, kas internetā ir brīvi un atklāti pieejama. Tā var ietvert publiski pieejamas tīmekļa lapas, publiskus forumus, publiskus emuārus, publiskas ziņas un citu publiski pieejamu tiešsaistes saturu. Piemēram, ja piedalāties publiski pieejamā tiešsaistes diskusiju forumā vai publicējat publisku emuāru vai citu ierakstu, mēs varam izmantot šo publiski pieejamo saturu modeļu apmācības nolūkos. Tomēr mēs veicam pasākumus, lai samazinātu personas informācijas apstrādi mūsu apmācības procesā.  Vācot publiski pieejamu interneta saturu, mēs apzināti neiegūstam datus no avotiem, par kuriem zināms, ka tie atrodas aiz maksas sienām, vai no tumšā tīmekļa. Turklāt mēs izmantojam filtrus, lai noņemtu materiālus, no kuriem nevēlamies, lai mūsu modeļi mācītos, piemēram, naida runu, pieaugušajiem paredzētu saturu, vietnes, kas apkopo personas informāciju, un surogātpastu. Pēc tam atlikusī informācija tiek izmantota mūsu modeļu apmācīšanai. 

Tīmekļa vietņu īpašnieki var pārvaldīt, vai publiski pieejamam saturam no viņu vietnēm drīkst piekļūt izmantošanai apmācībā, izmantojot standarta tīmekļa vadīklas, piemēram, robots.txt, lai aizliegtu GPTBot, kas var pārlūkot publiski pieejamu saturu un palīdzēt apmācīt mūsu modeļus. Mēs sniedzam norādījumus, lai palīdzētu tīmekļa vietņu īpašniekiem pārvaldīt to, kā viņu vietnes un saturs mijiedarbojas ar mūsu MI sistēmām. 

Mēs izmantojam arī informāciju no trešo pušu partneriem, lai palīdzētu apmācīt un uzlabot mūsu modeļus. Tā var ietvert informāciju datu kopās, kurām piekļūstam saskaņā ar līgumiem ar trešajām pusēm, kā arī informāciju, ko sniedz vai ģenerē cilvēki apmācītāji un pētnieki, ja to atļauj mūsu politikas un līgumi. Tas palīdz uzlabot mūsu modeļu kvalitāti, drošību un veiktspēju. Šie avoti atkarībā no datu kopas var ietvert tekstu, attēlus, audio, video vai citus datu veidus.

Dažos apmācības procesos mēs arvien vairāk izmantojam arī sintētiskos datus. Piemēram, mēs varam izmantot informāciju un savus modeļus, lai ģenerētu sintētiskas uzvednes, daudzvalodu piemērus vai citus apmācības materiālus. Sintētiskie dati var palīdzēt uzlabot modeļa veiktspēju, tostarp papildinot apmācības datus jomās, kur datu ir maz vai tie ir nelīdzsvaroti, un var arī atbalstīt pieejas modeļu izstrādei, kas stiprina privātumu.

Vai ChatGPT apmācīšanai tiek izmantota personas informācija?

Ievērojama tiešsaistes satura daļa ietver informāciju par cilvēkiem, tāpēc mūsu apmācības datos nejauši var būt iekļauta personas informācija. Tomēr mēs veicam pasākumus, lai samazinātu personas informācijas apstrādi mūsu apmācības procesā.

Apmācības datus mēs izmantojam, lai attīstītu modeļa spējas, piemēram, prognozēšanu, spriestspēju un problēmu risināšanu, nevis lai veidotu personu profilus, sazinātos ar tām vai personalizētu tām reklāmas.

Dažos gadījumos modeļi var mācīties no personas informācijas, lai saprastu, kā valodā darbojas tādi elementi kā vārdi un adreses, vai lai atpazītu publiskas personas un labi zināmas organizācijas vai objektus. Tas palīdz modelim ģenerēt precīzākas un kontekstam atbilstošākas atbildes.

Kā personas informācija tiek aizsargāta apmācības laikā?

Mēs aktīvi rīkojamies, lai apmācības laikā ierobežotu personas informācijas apstrādi. Piemēram, mēs izslēdzam zināmus avotus, kas apkopo lielu personas datu apjomu, izmantojam filtrēšanu, lai samazinātu personas informāciju apmācības procesā, un veicam pasākumus dublēta satura identificēšanai un noņemšanai, lai mazinātu apmācības datu atkārtošanas risku. Turklāt mēs apmācām savus modeļus izvairīties no atbildēm uz pieprasījumiem pēc privātas vai sensitīvas informācijas par personām. 

Cik ilgi mēs glabājam informāciju

Mēs glabājam informāciju apmācības datos tikai tik ilgi, cik tas ir saprātīgi nepieciešams šajā rakstā un mūsu Privātuma politikā aprakstītajiem mērķiem, tostarp mūsu modeļu izstrādei un uzlabošanai, kā arī saistītiem zinātniskās pētniecības mērķiem. Glabāšana tiek periodiski pārskatīta, lai pārliecinātos, ka tā joprojām ir nepieciešama, un tā atšķiras atkarībā no informācijas veida un izmantošanas. Nosakot glabāšanas termiņu, mēs ņemam vērā tādus faktorus kā informācijas apstrādes mērķis, informācijas apjoms, raksturs un sensitivitāte, iespējamais kaitējuma risks neatļautas izmantošanas vai izpaušanas gadījumā un jebkādi mums piemērojamie juridiskie pienākumi.

Kā ChatGPT izstrāde atbilst privātuma tiesību aktiem?

Mēs izmantojam apmācības informāciju likumīgi. Mūsu pamatmodeļi nodrošina plašu noderīgu lietojumu klāstu, tostarp piekļūstamības rīkus, klientu atbalstu, programmatūras izstrādi, personalizētu izglītību un zinātnisko pētniecību. Šīs spējas ir atkarīgas no liela mēroga apmācības datiem, tostarp publiski pieejamas informācijas un informācijas no trešo pušu partneriem. Visā apmācības procesā mēs piemērojam aizsardzības pasākumus, tostarp darbības, kas paredzētas personas informācijas apstrādes samazināšanai apmācības procesā un risku mazināšanai, kā aprakstīts šajā rakstā. Mēs pamatojam apmācības informācijā iekļautās personas informācijas vākšanu un izmantošanu ar leģitīmām interesēm saskaņā ar privātuma tiesību aktiem, piemēram, VDAR, tostarp lai apmācītu un uzlabotu mūsu modeļus lietotāju un plašākas sabiedrības labā atbilstoši mūsu misijai nodrošināt, ka mākslīgais vispārējais intelekts sniedz labumu ikvienam, kā sīkāk paskaidrots mūsu Privātuma politikā. Mēs esam veikuši datu aizsardzības ietekmes novērtējumu, lai palīdzētu nodrošināt, ka šo informāciju vācam un izmantojam likumīgi un atbildīgi.

Kad informācija var tikt kopīgota vai pārsūtīta

Mēs “nepārdodam” personas informāciju un izpaužam personas informāciju apmācības datos tikai ierobežotos apstākļos, kas aprakstīti mūsu Privātuma politikā. Piemēram, mēs varam kopīgot informāciju ar saistītajiem uzņēmumiem, piegādātājiem un pakalpojumu sniedzējiem, kas atbalsta mūsu modeļu izstrādi, testēšanu un uzlabošanu. Mēs varam arī izpaust informāciju, labticīgi uzskatot, ka šāda rīcība ir nepieciešama, lai izpildītu juridisku pienākumu vai aizsargātu mūsu un mūsu lietotāju, darbinieku vai sabiedrības tiesības, drošību un aizsardzību, kā aprakstīts mūsu Privātuma politikā.

Tā kā mūsu infrastruktūra ir globāla, personas informācija apmācības datos var tikt apstrādāta valstīs ārpus EEZ, Šveices vai Apvienotās Karalistes (tostarp Amerikas Savienotajās Valstīs). Ja tas notiek, mēs piemērojam atbilstošus aizsardzības pasākumus, piemēram, lēmumus par aizsardzības līmeņa pietiekamību vai līguma standartklauzulas, kā aprakstīts mūsu Privātuma politikā.

Jūsu tiesības un kā tās izmantot

Mēs atbildam uz iebildumu pieprasījumiem un līdzīgiem tiesību pieprasījumiem. Valodas apguves rezultātā ChatGPT atbildēs dažkārt var būt iekļauta personas informācija par personām, kuru personas informācija publiskajā internetā parādās vairākas reizes (piemēram, par publiskām personām). Personas noteiktās jurisdikcijās var iebilst pret viņu personas informācijas apstrādi mūsu modeļos vai iesniegt citus datu subjektu tiesību pieprasījumus, izmantojot mūsu Privātuma portālu. Šīs tiesības varat izmantot arī, sazinoties ar privacy@openai.com

Lai palīdzētu mums izvērtēt jūsu pieprasījumu un uz to atbildēt, lūdzu, sniedziet pietiekami daudz informācijas, lai mēs saprastu, uz kādu personas informāciju jūsu pieprasījums attiecas, piemēram, jūsu vārdu, attiecīgos URL, konkrētus modeļa izvades piemērus vai citu informāciju, kas palīdz identificēt problēmu. Dažos gadījumos, pirms varam rīkoties, mēs varam lūgt jūs verificēt savu identitāti vai apstiprināt, ka informācija attiecas uz jums. Plašāka informācija par šo pieprasījumu iesniegšanu, tostarp labā prakse un tas, kā pieprasījumi tiek izskatīti, ir pieejama mūsu Palīdzības centra rakstā par personas datu noņemšanu no ChatGPT. Mēs izskatām pieprasījumus saskaņā ar piemērojamajiem privātuma tiesību aktiem un atbildam piemērojamajos likumā noteiktajos termiņos.

Lūdzu, ņemiet vērā, ka saskaņā ar privātuma tiesību aktiem dažas tiesības var nebūt absolūtas. Piemēram, mēs varam nespēt izpildīt pieprasījumu, ja nevaram pārbaudīt attiecīgo informāciju, ja pieprasījums neattiecas uz OpenAI apstrādātu personas informāciju, ja ir piemērojams izņēmums vai ja mums ir cits likumīgs iemesls tā rīkoties. Pieprasījumi tiek vērtēti katrā gadījumā atsevišķi, un tas var ietvert privātuma tiesību līdzsvarošanu ar citiem svarīgiem apsvērumiem, piemēram, vārda brīvību un sabiedrības interesēm. 

Tomēr mēs cenšamies par prioritāti noteikt personas informācijas aizsardzību un ievērojam visus piemērojamos privātuma tiesību aktus. Ja uzskatāt, ka neesam pienācīgi risinājuši kādu jautājumu, jums ir tiesības iesniegt sūdzību vietējai uzraudzības iestādei.

Lai iegūtu plašāku informāciju par OpenAI praksi attiecībā uz personas informāciju, ko vācam no jums vai par jums, kad izmantojat mūsu tīmekļa vietni, lietotnes un pakalpojumus, lūdzu, skatiet mūsu Privātuma politiku.

Vai šis raksts bija noderīgs?