OpenAI-jevi temeljni modeli, uključujući modele na kojima se temelji ChatGPT, razvijaju se uz pomoć triju glavnih izvora informacija: (1) javno dostupnih informacija na internetu, (2) informacija kojima pristupamo u suradnji s trećim stranama i (3) informacija koje pružaju ili stvaraju naši korisnici, ljudski treneri i istraživači.
Razvoj temeljnih modela poput onih koji se upotrebljavaju u ChatGPT-u obuhvaća nekoliko faza, uključujući pripremu podataka za treniranje, predtreniranje i naknadno treniranje te stalno ocjenjivanje i poboljšavanje nakon uvođenja. U tim se fazama u različite svrhe mogu upotrebljavati različite vrste informacija, među ostalim za poboljšanje učinkovitosti, pouzdanosti i sigurnosti modela.
Ovaj članak donosi pregled informacija kojima se služimo pri razvoju tih modela, načina na koji ih prikupljamo i upotrebljavamo u skladu sa zakonima o zaštiti privatnosti te zaštitnih mjera koje primjenjujemo tijekom cijelog procesa treniranja. Da biste saznali kako prikupljamo i upotrebljavamo informacije korisnika naših usluga, uključujući kako onemogućiti upotrebu razgovora u ChatGPT-u za poboljšavanje naših modela, pročitajte naš Pravilnik o zaštiti privatnosti i ovaj članak Centra za pomoć.
Što je ChatGPT i kako funkcionira?
ChatGPT je usluga utemeljena na umjetnoj inteligenciji kojoj možete pristupiti putem interneta ili aplikacije. ChatGPT možete upotrebljavati za mnoge zadatke, uključujući organiziranje i sažimanje informacija, pomoć pri prevođenju, programiranju, istraživanju i analizi, izvršavanje zadataka u više koraka s pomoću različitih alata, analiziranje ili generiranje slika, poticanje kreativnosti i osmišljavanje ideja te druge svakodnevne aktivnosti. ChatGPT je osmišljen tako da razumije pitanja i upute korisnika te odgovara na njih učenjem obrazaca iz velikih količina informacija, uključujući tekst, slike, zvuk i videozapise.
Tijekom treniranja model analizira odnose unutar tih podataka, primjerice kako se riječi obično zajedno pojavljuju u određenom kontekstu, i tim se razumijevanjem služi kako bi pri generiranju odgovora predvidio sljedeću najvjerojatniju riječ, riječ po riječ. Tekst se može pretvoriti u manje jedinice, koje se katkad nazivaju „tokeni”, a mogu predstavljati cijele riječi, dijelove riječi ili interpunkcijske znakove. Tokeni su osnovne jedinice teksta koje model obrađuje. Slično tome, modeli koji generiraju druge vrste sadržaja, poput slika, uče obrasce odnosa među pikselima te između piksela i pripadajućih opisa u podacima za treniranje.
Primjerice, tijekom procesa učenja modela (poznatog kao „treniranje”) model može dobiti zadatak da dovrši rečenicu poput: „Umjesto da skrene lijevo, skrenula je ___.” U ranoj fazi treniranja njegovi su odgovori uglavnom nasumični. Međutim, dok obrađuje veliku količinu teksta i uči iz nje, model sve bolje prepoznaje obrasce i predviđa najvjerojatniju sljedeću riječ. Taj se proces ponavlja na milijunima rečenica kako bi model usavršio svoje razumijevanje i povećao točnost.
Budući da postoji više smislenih načina za dovršavanje rečenice, primjerice „Umjesto da skrene lijevo, skrenula je desno”, „okrenula se” ili „vratila se”, odgovori modela neizbježno sadržavaju element nasumičnosti. Zbog toga isto pitanje pri različitim upitima može dati različite odgovore.
Modeli strojnog učenja sastoje se od velikih skupova brojeva, poznatih kao „težine” ili „parametri”, te koda koji tumači i upotrebljava te brojeve. Ti modeli ne pohranjuju niti čuvaju kopije podataka na kojima su trenirani. Umjesto toga, dok model uči, vrijednosti njegovih parametara blago se prilagođavaju kako bi odražavale prepoznate obrasce. U prethodnom je primjeru model od predviđanja nasumičnih riječi napredovao do točnijih predviđanja, ne pohranjivanjem rečenica za treniranje, nego ažuriranjem svojih unutarnjih parametara. Model ne čuva kopije rečenica, slika ili zvučnih zapisa koje obrađuje tijekom treniranja. ChatGPT ne „kopira i lijepi” sadržaj iz podataka za treniranje. Slično tome, nastavnik nakon opsežnog proučavanja može objasniti pojmove razumijevanjem odnosa među idejama, a da pritom ne pamti niti doslovno ponavlja izvorne materijale. Pri generiranju odgovora na korisnički zahtjev model se služi tim naučenim težinama kako bi predvidio i stvorio nov sadržaj.
Koja se vrsta informacija upotrebljava za podučavanje ChatGPT-a?
Kad je riječ o javno dostupnom internetskom sadržaju, upotrebljavamo samo informacije koje su besplatno i otvoreno dostupne na internetu. To može uključivati javno dostupne mrežne stranice, javne forume, javne blogove, javne objave i drugi javno dostupan internetski sadržaj. Primjerice, ako sudjelujete na javno dostupnom internetskom forumu ili objavite javni blog ili drugu javnu objavu, taj javno dostupan sadržaj možemo upotrijebiti za treniranje modela. Međutim, poduzimamo korake kako bismo smanjili obradu osobnih podataka tijekom treniranja. Pri prikupljanju javno dostupnog internetskog sadržaja ne prikupljamo namjerno podatke iz izvora za koje znamo da su dostupni uz naplatu ni s dark weba. Osim toga, primjenjujemo filtre za uklanjanje materijala iz kojih ne želimo da naši modeli uče, kao što su govor mržnje, sadržaj za odrasle, stranice koje objedinjuju osobne podatke i neželjeni sadržaj. Preostale informacije zatim se upotrebljavaju za treniranje naših modela.
Vlasnici mrežnih stranica mogu upravljati pristupom javno dostupnom sadržaju na svojim stranicama radi treniranja s pomoću standardnih mrežnih kontrola, kao što je robots.txt, kako bi onemogućili GPTBot, koji može pretraživati javno dostupan sadržaj radi treniranja naših modela. Pružamo smjernice koje vlasnicima mrežnih stranica pomažu upravljati načinom na koji njihove stranice i sadržaj stupaju u interakciju s našim sustavima umjetne inteligencije.
Za treniranje i poboljšavanje svojih modela upotrebljavamo i informacije partnera trećih strana. To može uključivati informacije iz skupova podataka kojima pristupamo na temelju ugovora s trećim stranama te informacije koje pružaju ili stvaraju ljudski treneri i istraživači, kada je to dopušteno našim pravilima i ugovorima. To pomaže poboljšati kvalitetu, sigurnost i učinkovitost naših modela. Ovisno o skupu podataka, ti izvori mogu sadržavati tekst, slike, zvuk, videozapise ili druge vrste podataka.
U nekim procesima treniranja sve više upotrebljavamo i sintetičke podatke. Primjerice, informacije i naše modele možemo upotrebljavati za generiranje sintetičkih upita, višejezičnih primjera ili drugih materijala za treniranje. Sintetički podaci mogu poboljšati učinkovitost modela, među ostalim dopunjavanjem podataka za treniranje u područjima u kojima su podaci oskudni ili neuravnoteženi, a mogu poduprijeti i pristupe razvoju modela koji bolje štite privatnost.
Upotrebljavaju li se osobni podaci za podučavanje ChatGPT-a?
Znatan dio internetskog sadržaja uključuje informacije o ljudima, pa naši podaci za treniranje mogu slučajno sadržavati osobne podatke. Međutim, poduzimamo korake kako bismo smanjili obradu osobnih podataka tijekom treniranja.
Podatke za treniranje upotrebljavamo za razvoj sposobnosti modela, kao što su predviđanje, rasuđivanje i rješavanje problema, a ne za izradu profila pojedinaca, kontaktiranje s njima ili prilagodbu oglasa njima.
U nekim slučajevima modeli mogu učiti iz osobnih podataka kako bi razumjeli funkciju elemenata poput imena i adresa u jeziku ili prepoznali javne osobe i poznate subjekte. To modelu pomaže generirati točnije odgovore koji bolje odgovaraju kontekstu.
Kako se osobni podaci štite tijekom treniranja?
Aktivno poduzimamo korake kako bismo ograničili obradu osobnih podataka tijekom treniranja. Primjerice, isključujemo poznate izvore koji objedinjuju velike količine osobnih podataka, primjenjujemo filtre kako bismo smanjili količinu osobnih podataka u procesu treniranja te poduzimamo korake za prepoznavanje i uklanjanje dupliciranog sadržaja kako bismo smanjili rizik od ponavljanja podataka za treniranje. Osim toga, svoje modele treniramo da ne odgovaraju na zahtjeve za privatne ili osjetljive informacije o pojedincima.
Koliko dugo čuvamo informacije
Informacije u podacima za treniranje čuvamo samo onoliko dugo koliko je razumno potrebno za svrhe opisane u ovom članku i našem Pravilniku o zaštiti privatnosti, uključujući razvoj i poboljšavanje naših modela te povezane svrhe znanstvenog istraživanja. Potreba za čuvanjem povremeno se preispituje, a razdoblje čuvanja ovisi o vrsti informacija i načinu njihove upotrebe. Pri određivanju razdoblja čuvanja uzimamo u obzir čimbenike kao što su svrha obrade informacija, njihova količina, priroda i osjetljivost, mogući rizik od štete zbog neovlaštene upotrebe ili otkrivanja te sve pravne obveze koje se na nas primjenjuju.
Kako je razvoj ChatGPT-a usklađen sa zakonima o zaštiti privatnosti?
Informacije za treniranje upotrebljavamo zakonito. Naši temeljni modeli omogućuju širok raspon korisnih primjena, uključujući alate za pristupačnost, korisničku podršku, razvoj softvera, personalizirano obrazovanje i znanstvena istraživanja. Te mogućnosti ovise o podacima za treniranje velikih razmjera, uključujući javno dostupne informacije i informacije partnera trećih strana. Tijekom cijelog procesa treniranja primjenjujemo zaštitne mjere, uključujući korake namijenjene smanjenju obrade osobnih podataka u procesu treniranja i ublažavanju rizika, kako je opisano u ovom članku. Prikupljanje i upotrebu osobnih podataka uključenih u informacije za treniranje temeljimo na legitimnim interesima u skladu sa zakonima o zaštiti privatnosti poput GDPR-a, među ostalim radi treniranja i poboljšavanja naših modela za korisnike i šire društvo, u skladu s našom misijom da opća umjetna inteligencija koristi svima, kao što je podrobnije objašnjeno u našem Pravilniku o zaštiti privatnosti. Proveli smo procjenu učinka na zaštitu podataka kako bismo lakše osigurali da te informacije prikupljamo i upotrebljavamo zakonito i odgovorno.
Kada se informacije mogu dijeliti ili prenositi
Ne „prodajemo” osobne podatke i otkrivamo ih u sklopu podataka za treniranje samo u ograničenim okolnostima opisanima u našem Pravilniku o zaštiti privatnosti. Primjerice, informacije možemo dijeliti s povezanim društvima, dobavljačima i pružateljima usluga koji podupiru razvoj, testiranje i poboljšavanje naših modela. Informacije možemo otkriti i ako u dobroj vjeri smatramo da je to nužno radi ispunjavanja pravne obveze ili zaštite naših prava i sigurnosti te prava i sigurnosti naših korisnika, zaposlenika ili javnosti, kako je opisano u našem Pravilniku o zaštiti privatnosti.
Budući da je naša infrastruktura globalna, osobni podaci u podacima za treniranje mogu se obrađivati u zemljama izvan EGP-a, Švicarske ili Ujedinjenog Kraljevstva, uključujući Sjedinjene Američke Države. U tim slučajevima primjenjujemo odgovarajuće zaštitne mjere, kao što su odluke o primjerenosti ili standardne ugovorne klauzule, kako je opisano u našem Pravilniku o zaštiti privatnosti.
Vaša prava i kako ih ostvariti
Odgovaramo na prigovore i slične zahtjeve za ostvarivanje prava. Budući da uči jezik, ChatGPT u odgovorima katkad može navesti osobne podatke pojedinaca čiji se osobni podaci više puta pojavljuju na javnom internetu, primjerice javnih osoba. Pojedinci u određenim jurisdikcijama mogu se usprotiviti obradi svojih osobnih podataka u našim modelima ili podnijeti druge zahtjeve za ostvarivanje prava ispitanika putem našeg Portala za privatnost. Ta prava možete ostvariti i obraćanjem na adresu privacy@openai.com.
Kako biste nam pomogli procijeniti vaš zahtjev i odgovoriti na njega, navedite dovoljno informacija da možemo razumjeti na koje se osobne podatke zahtjev odnosi, primjerice svoje ime, relevantne URL-ove, konkretne primjere rezultata modela ili druge pojedinosti koje pomažu utvrditi problem. U nekim slučajevima možemo zatražiti da potvrdite svoj identitet ili da se informacije odnose na vas prije nego što poduzmemo radnje. Više informacija o podnošenju tih zahtjeva, uključujući najbolje prakse i način njihove provjere, dostupno je u našem članku Centra za pomoć o uklanjanju osobnih podataka iz ChatGPT-a. Zahtjeve razmatramo u skladu s primjenjivim zakonima o zaštiti privatnosti i odgovaramo u zakonski propisanim rokovima.
Imajte na umu da, u skladu sa zakonima o zaštiti privatnosti, neka prava možda nisu apsolutna. Primjerice, možda nećemo moći ispuniti zahtjev ako ne možemo provjeriti relevantne informacije, ako se zahtjev ne odnosi na osobne podatke koje obrađuje OpenAI, ako se primjenjuje iznimka ili ako za to postoji drugi zakonit razlog. Zahtjevi se procjenjuju zasebno te mogu zahtijevati usklađivanje prava na privatnost s drugim važnim pitanjima, kao što su sloboda izražavanja i javni interes.
Unatoč tome, nastojimo dati prednost zaštiti osobnih podataka i poštovati sve primjenjive zakone o zaštiti privatnosti. Ako smatrate da nismo primjereno riješili problem, imate pravo podnijeti pritužbu svojem lokalnom nadzornom tijelu.
Više informacija o praksama društva OpenAI u vezi s osobnim podacima koje prikupljamo od vas ili o vama dok upotrebljavate naše mrežne stranice, aplikacije i usluge potražite u našem Pravilniku o zaštiti privatnosti.
