OpenAI pamatmodeļi, tostarp modeļi, kas nodrošina ChatGPT darbību, tiek izstrādāti, izmantojot trīs galvenos informācijas avotus: 1) internetā publiski pieejamu informāciju, 2) informāciju, kurai piekļūstam sadarbībā ar trešajām pusēm, un 3) informāciju, ko sniedz vai ģenerē mūsu lietotāji, apmācītāji un pētnieki.
Tādu pamatmodeļu izstrāde, kādi tiek izmantoti ChatGPT, ietver vairākus posmus, tostarp apmācības datu sagatavošanu, pirmsapmācību un pēcapmācību, kā arī pastāvīgu izvērtēšanu un uzlabošanu pēc ieviešanas. Šajos posmos dažādiem mērķiem var izmantot atšķirīgu veidu informāciju, tostarp modeļa veiktspējas, uzticamības un drošības uzlabošanai.
Šajā rakstā ir sniegts pārskats par informāciju, ko izmantojam šo modeļu izstrādē, par to, kā vācam un izmantojam šo informāciju atbilstoši privātuma tiesību aktiem, un par aizsardzības pasākumiem, ko piemērojam visā apmācības procesā. Lai uzzinātu, kā vācam un izmantojam mūsu pakalpojumu lietotāju informāciju, tostarp kā atteikties no ChatGPT sarunu izmantošanas mūsu modeļu uzlabošanai, skatiet mūsu Privātuma politiku un šo Palīdzības centra rakstu.
Kas ir ChatGPT, un kā tas darbojas?
ChatGPT ir mākslīgajā intelektā balstīts pakalpojums, kam var piekļūt internetā vai lietotnē. ChatGPT var izmantot visdažādākajiem uzdevumiem, tostarp informācijas kārtošanai un apkopošanai, tulkošanai, programmēšanai, pētniecībai un analīzei, vairāku darbību uzdevumu izpildei dažādos rīkos, attēlu analizēšanai vai ģenerēšanai, radošuma un ideju rosināšanai, kā arī citām ikdienas darbībām. ChatGPT ir izstrādāts tā, lai saprastu lietotāju jautājumus un norādījumus un uz tiem atbildētu, apgūstot likumsakarības no liela informācijas apjoma, tostarp teksta, attēliem, audio un video.
Apmācības laikā modelis analizē šo datu savstarpējās sakarības, piemēram, to, kādi vārdi noteiktā kontekstā parasti tiek lietoti kopā, un izmanto šo izpratni, lai, ģenerējot atbildi, pa vienam vārdam prognozētu nākamo ticamāko vārdu. Tekstu var sadalīt mazākās vienībās, ko dažkārt dēvē par “tokeniem” un kas var apzīmēt veselus vārdus, vārdu daļas vai pieturzīmes. Tokeni ir teksta pamatelementi, ko modelis apstrādā. Līdzīgi arī modeļi, kas ģenerē cita veida saturu, piemēram, attēlus, apgūst likumsakarības starp pikseļiem un ar tiem saistītajiem parakstiem apmācības datos.
Piemēram, modeļa mācīšanās procesā (ko dēvē par “apmācību”) modelim varētu lūgt pabeigt šādu teikumu: “Tā vietā, lai pagrieztos pa kreisi, viņa pagriezās ___.” Apmācības sākumā tā atbildes lielākoties ir nejaušas. Taču, apstrādājot lielu teksta apjomu un no tā mācoties, modelis arvien labāk atpazīst likumsakarības un prognozē nākamo ticamāko vārdu. Šis process tiek atkārtots miljoniem teikumu, lai pilnveidotu modeļa izpratni un uzlabotu tā precizitāti.
Tā kā teikumu var ticami pabeigt vairākos veidos, piemēram, “Tā vietā, lai pagrieztos pa kreisi, viņa pagriezās pa labi”, “apkārt” vai “atpakaļ”, modeļa atbildēm piemīt zināma nejaušība. Tāpēc, atkārtoti uzdodot vienu un to pašu jautājumu, var saņemt atšķirīgas atbildes.
Mašīnmācīšanās modeļus veido lielas skaitļu kopas, ko dēvē par “svariem” vai “parametriem”, un kods, kas šos skaitļus interpretē un izmanto. Šie modeļi neglabā un nesaglabā to apmācībā izmantoto datu kopijas. Modelim mācoties, tā parametru vērtības tiek nedaudz pielāgotas, lai atspoguļotu modeļa konstatētās likumsakarības. Iepriekšējā piemērā modelis no nejaušu vārdu prognozēšanas pārgāja uz precīzākām prognozēm, nevis saglabājot apmācības teikumus, bet gan atjauninot savus iekšējos parametrus. Modelis nesaglabā apmācības laikā apstrādāto teikumu, attēlu vai audio kopijas. ChatGPT “nekopē un neielīmē” saturu no saviem apmācības datiem. Līdzīgi skolotājs pēc padziļinātām studijām var izskaidrot jēdzienus, izprotot ideju savstarpējās sakarības, nevis iegaumējot vai burtiski atkārtojot sākotnējos materiālus. Ģenerējot atbildi uz lietotāja pieprasījumu, modelis izmanto šos apgūtos svarus, lai prognozētu un radītu jaunu saturu.
Kāda veida informācija tiek izmantota ChatGPT apmācīšanai?
No internetā publiski pieejamā satura izmantojam tikai tādu informāciju, kas internetā ir brīvi un atklāti pieejama. Tās var būt publiski pieejamas tīmekļa lapas, publiski forumi, emuāri un ieraksti, kā arī cits publiski pieejams tiešsaistes saturs. Piemēram, ja piedalāties publiski pieejamā tiešsaistes diskusiju forumā vai publicējat publisku emuāru vai citu ierakstu, mēs šo publiski pieejamo saturu varam izmantot modeļu apmācībai. Tomēr mēs veicam pasākumus, lai apmācības procesā samazinātu personas informācijas apstrādi. Vācot internetā publiski pieejamu saturu, mēs apzināti neiegūstam datus no avotiem, par kuriem zināms, ka tie atrodas aiz maksas piekļuves ierobežojumiem, vai no tumšā tīmekļa. Turklāt izmantojam filtrus, lai noņemtu materiālus, no kuriem nevēlamies apmācīt savus modeļus, piemēram, naida runu, pieaugušajiem paredzētu saturu, vietnes, kas apkopo personas informāciju, un surogātpastu. Atlikušo informāciju pēc tam izmanto mūsu modeļu apmācībai.
Vietņu īpašnieki var pārvaldīt, vai viņu vietņu publiski pieejamajam saturam drīkst piekļūt apmācības nolūkos, izmantojot standarta tīmekļa vadības līdzekļus, piemēram, robots.txt, lai liegtu piekļuvi GPTBot, kas var pārmeklēt publiski pieejamu saturu mūsu modeļu apmācības vajadzībām. Mēs piedāvājam norādījumus, lai palīdzētu vietņu īpašniekiem pārvaldīt savu vietņu un satura mijiedarbību ar mūsu MI sistēmām.
Modeļu apmācībai un uzlabošanai izmantojam arī trešo pušu partneru sniegto informāciju. Tā var ietvert informāciju datu kopās, kurām piekļūstam saskaņā ar līgumiem ar trešajām pusēm, kā arī apmācītāju un pētnieku sniegtu vai ģenerētu informāciju, ja to atļauj mūsu politikas un līgumi. Tas palīdz uzlabot mūsu modeļu kvalitāti, drošību un veiktspēju. Atkarībā no datu kopas šie avoti var ietvert tekstu, attēlus, audio, video vai cita veida datus.
Dažos apmācības procesos arvien vairāk izmantojam arī sintētiskos datus. Piemēram, varam izmantot informāciju un savus modeļus, lai ģenerētu sintētiskas uzvednes, daudzvalodu piemērus vai citus apmācības materiālus. Sintētiskie dati var palīdzēt uzlabot modeļa veiktspēju, tostarp papildinot apmācības datus jomās, kur datu ir maz vai tie nav līdzsvaroti, kā arī veicināt privātumu uzlabojošas pieejas modeļu izstrādei.
Vai ChatGPT apmācīšanai tiek izmantota personas informācija?
Ievērojama daļa tiešsaistes satura ietver informāciju par cilvēkiem, tāpēc mūsu apmācības datos var nejauši nonākt arī personas informācija. Tomēr mēs veicam pasākumus, lai apmācības procesā samazinātu personas informācijas apstrādi.
Apmācības datus izmantojam, lai attīstītu modeļa spējas, piemēram, prognozēšanu, spriestspēju un problēmu risināšanu, nevis lai veidotu personu profilus, sazinātos ar tām vai personalizētu tām reklāmas.
Dažos gadījumos modeļi var mācīties no personas informācijas, lai saprastu, kā valodā darbojas tādi elementi kā vārdi un adreses, vai atpazītu sabiedrībā zināmas personas un plaši pazīstamas organizācijas. Tas palīdz modelim ģenerēt precīzākas un kontekstam atbilstošākas atbildes.
Kā apmācības laikā tiek aizsargāta personas informācija?
Mēs aktīvi rīkojamies, lai apmācības laikā ierobežotu personas informācijas apstrādi. Piemēram, mēs izslēdzam zināmus avotus, kuros apkopots liels personas datu apjoms, izmantojam filtrēšanu, lai apmācības procesā samazinātu personas informācijas apjomu, kā arī identificējam un noņemam dublētu saturu, lai mazinātu apmācības datu atkārtošanas risku. Turklāt apmācām savus modeļus neatbildēt uz pieprasījumiem sniegt privātu vai sensitīvu informāciju par personām.
Cik ilgi glabājam informāciju
Informāciju apmācības datos glabājam tikai tik ilgi, cik tas ir pamatoti nepieciešams šajā rakstā un mūsu Privātuma politikā aprakstītajiem mērķiem, tostarp mūsu modeļu izstrādei un uzlabošanai, kā arī saistītiem zinātniskās pētniecības mērķiem. Glabāšanas nepieciešamība tiek regulāri pārskatīta, un glabāšanas ilgums atšķiras atkarībā no informācijas veida un tās izmantošanas. Nosakot glabāšanas ilgumu, ņemam vērā tādus faktorus kā informācijas apstrādes mērķis, informācijas apjoms, raksturs un sensitivitāte, iespējamais kaitējuma risks neatļautas izmantošanas vai izpaušanas gadījumā un mums saistošie juridiskie pienākumi.
Kā ChatGPT izstrāde atbilst privātuma tiesību aktiem?
Apmācības informāciju izmantojam likumīgi. Mūsu pamatmodeļi nodrošina plašu noderīgu lietojumu klāstu, tostarp pieejamības rīkus, klientu atbalstu, programmatūras izstrādi, personalizētu izglītību un zinātnisko pētniecību. Šo spēju nodrošināšanai nepieciešami liela mēroga apmācības dati, tostarp publiski pieejama informācija un trešo pušu partneru sniegta informācija. Visā apmācības procesā piemērojam aizsardzības pasākumus, tostarp šajā rakstā aprakstītos pasākumus, kas paredzēti personas informācijas apstrādes samazināšanai un risku mazināšanai. Apmācības informācijā ietvertās personas informācijas vākšanu un izmantošanu pamatojam ar leģitīmajām interesēm saskaņā ar tādiem privātuma tiesību aktiem kā VDAR. Šīs intereses ietver mūsu modeļu apmācību un uzlabošanu lietotāju un plašākas sabiedrības labā atbilstoši mūsu misijai nodrošināt, lai mākslīgais vispārējais intelekts sniegtu labumu ikvienam. Plašāks skaidrojums ir sniegts mūsu Privātuma politikā. Esam veikuši novērtējumu par ietekmi uz datu aizsardzību, lai palīdzētu nodrošināt, ka šo informāciju vācam un izmantojam likumīgi un atbildīgi.
Kad informāciju var kopīgot vai pārsūtīt
Mēs “nepārdodam” personas informāciju un apmācības datos ietverto personas informāciju izpaužam tikai mūsu Privātuma politikā aprakstītajos ierobežotajos gadījumos. Piemēram, varam kopīgot informāciju ar saistītajiem uzņēmumiem, piegādātājiem un pakalpojumu sniedzējiem, kas palīdz izstrādāt, testēt un uzlabot mūsu modeļus. Varam arī izpaust informāciju, ja labticīgi uzskatām, ka tas nepieciešams juridiska pienākuma izpildei vai mūsu, mūsu lietotāju, darbinieku vai sabiedrības tiesību, drošuma un drošības aizsardzībai, kā aprakstīts mūsu Privātuma politikā.
Tā kā mūsu infrastruktūra ir globāla, apmācības datos ietvertā personas informācija var tikt apstrādāta valstīs ārpus EEZ, Šveices vai Apvienotās Karalistes, tostarp Amerikas Savienotajās Valstīs. Šādos gadījumos piemērojam atbilstošus aizsardzības pasākumus, piemēram, lēmumus par aizsardzības līmeņa pietiekamību vai līguma standartklauzulas, kā aprakstīts mūsu Privātuma politikā.
Jūsu tiesības un to izmantošana
Mēs atbildam uz iebildumiem un līdzīgiem pieprasījumiem saistībā ar personas tiesībām. Valodas apguves rezultātā ChatGPT atbildēs dažkārt var būt ietverta personas informācija par cilvēkiem, kuru personas informācija publiskajā internetā parādās vairākkārt, piemēram, par sabiedrībā zināmām personām. Noteiktās jurisdikcijās personas var iebilst pret viņu personas informācijas apstrādi mūsu modeļos vai iesniegt citus datu subjektu tiesību pieprasījumus mūsu Privātuma portālā. Šīs tiesības varat izmantot arī, rakstot uz privacy@openai.com.
Lai palīdzētu mums izvērtēt jūsu pieprasījumu un uz to atbildēt, lūdzu, sniedziet pietiekamu informāciju, lai mēs saprastu, uz kādu personas informāciju pieprasījums attiecas, piemēram, jūsu vārdu, attiecīgos vietrāžus URL, konkrētus modeļa izvades piemērus vai citu informāciju, kas palīdz identificēt problēmu. Dažos gadījumos, pirms varēsim rīkoties, varam lūgt jums apliecināt savu identitāti vai apstiprināt, ka informācija attiecas uz jums. Plašāka informācija par šo pieprasījumu iesniegšanu, tostarp ieteicamā prakse un pieprasījumu izskatīšanas kārtība, ir pieejama mūsu Palīdzības centra rakstā par personas datu noņemšanu no ChatGPT. Pieprasījumus izskatām saskaņā ar piemērojamajiem privātuma tiesību aktiem un atbildam tiesību aktos noteiktajos termiņos.
Ņemiet vērā, ka saskaņā ar privātuma tiesību aktiem dažas tiesības var nebūt absolūtas. Piemēram, mēs varam nespēt izpildīt pieprasījumu, ja nevaram pārbaudīt attiecīgo informāciju, ja pieprasījums neattiecas uz OpenAI apstrādātu personas informāciju, ja ir piemērojams izņēmums vai ja mums ir cits likumīgs pamats to neizpildīt. Pieprasījumi tiek izvērtēti katrā gadījumā atsevišķi, un var būt nepieciešams līdzsvarot tiesības uz privātumu ar citiem svarīgiem apsvērumiem, piemēram, vārda brīvību un sabiedrības interesēm.
Tomēr cenšamies par prioritāti izvirzīt personas informācijas aizsardzību un ievērot visus piemērojamos privātuma tiesību aktus. Ja uzskatāt, ka neesam pienācīgi atrisinājuši kādu jautājumu, jums ir tiesības iesniegt sūdzību vietējā uzraudzības iestādē.
Plašāku informāciju par OpenAI praksi attiecībā uz personas informāciju, ko vācam no jums vai par jums, kad izmantojat mūsu tīmekļa vietni, lietotnes un pakalpojumus, skatiet mūsu Privātuma politikā.
