OpenAI-jevi temeljni modeli, uključujući modele koji pokreću ChatGPT, razvijaju se pomoću tri glavna izvora informacija: (1) javno dostupnih informacija na internetu, (2) informacija kojima pristupamo u saradnji s trećim stranama i (3) informacija koje pružaju ili stvaraju naši korisnici, treneri i istraživači.
Razvoj temeljnih modela poput onih koji se koriste u usluzi ChatGPT obuhvata nekoliko faza, uključujući pripremu podataka za treniranje, predobuku i naknadno treniranje, kao i kontinuiranu evaluaciju i poboljšavanje nakon uvođenja. U tim fazama mogu se koristiti različite vrste informacija u razne svrhe, uključujući poboljšavanje performansi, pouzdanosti i sigurnosti modela.
Ovaj članak daje pregled informacija koje koristimo pri razvoju ovih modela, načina na koji ih prikupljamo i koristimo u skladu sa zakonima o privatnosti te zaštitnih mjera koje primjenjujemo tokom cijelog procesa treniranja. Da biste saznali kako prikupljamo i koristimo informacije korisnika naših usluga, uključujući kako isključiti korištenje razgovora u usluzi ChatGPT za poboljšavanje naših modela, pogledajte naša Pravila privatnosti i ovaj članak Centra za pomoć.
Šta je ChatGPT i kako funkcionira?
ChatGPT je usluga zasnovana na umjetnoj inteligenciji kojoj možete pristupiti putem interneta ili aplikacije. ChatGPT možete koristiti za širok raspon zadataka, uključujući organiziranje i sažimanje informacija, pomoć pri prevođenju, programiranju, istraživanju i analizi, izvršavanje zadataka u više koraka pomoću različitih alata, analiziranje ili generiranje slika, poticanje kreativnosti i ideja te druge svakodnevne aktivnosti. ChatGPT je osmišljen tako da razumije pitanja i upute korisnika te odgovara na njih učenjem obrazaca iz velikih količina informacija, uključujući tekst, slike, zvuk i videozapise.
Tokom treniranja model analizira odnose unutar tih podataka, kao što je način na koji se riječi obično zajedno pojavljuju u kontekstu, i koristi to razumijevanje kako bi pri generiranju odgovora predvidio sljedeću najvjerovatniju riječ, riječ po riječ. Tekst se može pretvoriti u manje jedinice, koje se ponekad nazivaju „tokeni“, a mogu predstavljati cijele riječi, dijelove riječi ili interpunkcijske znakove. Tokeni su osnovni elementi teksta koje model obrađuje. Slično tome, modeli koji generiraju druge vrste sadržaja, poput slika, uče obrasce odnosa piksela međusobno i s povezanim opisima u podacima za treniranje.
Naprimjer, tokom procesa učenja modela (poznatog kao „treniranje“), model može dobiti zadatak da dovrši rečenicu poput: „Umjesto da skrene lijevo, skrenula je ___.“ U ranoj fazi treniranja njegovi su odgovori uglavnom nasumični. Međutim, kako model obrađuje veliku količinu teksta i uči iz nje, postaje bolji u prepoznavanju obrazaca i predviđanju najvjerovatnije sljedeće riječi. Ovaj se postupak ponavlja na milionima rečenica kako bi model unaprijedio svoje razumijevanje i povećao tačnost.
Budući da se rečenica može dovršiti na više smislenih načina, poput „Umjesto da skrene lijevo, skrenula je desno“, „u krug“ ili „nazad“, odgovori modela neminovno sadrže određeni element nasumičnosti. Zbog toga isto pitanje može dati različite odgovore pri različitim upitima.
Modeli mašinskog učenja sastoje se od velikih skupova brojeva poznatih kao „težine“ ili „parametri“, zajedno s kôdom koji te brojeve tumači i koristi. Ovi modeli ne pohranjuju niti zadržavaju kopije podataka na kojima su trenirani. Umjesto toga, dok model uči, vrijednosti njegovih parametara neznatno se prilagođavaju kako bi odražavale obrasce koje je prepoznao. U prethodnom primjeru model je napredovao od predviđanja nasumičnih riječi do preciznijih predviđanja, ne pohranjivanjem rečenica za treniranje, nego ažuriranjem svojih internih parametara. Model ne zadržava kopije rečenica, slika ili zvučnih zapisa koje obrađuje tokom treniranja. ChatGPT ne „kopira i lijepi“ sadržaj iz podataka za treniranje. Slično tome, nastavnik nakon opsežnog učenja može objasniti pojmove jer razumije odnose među idejama, a da pritom ne pamti niti doslovno reproducira izvorne materijale. Pri generiranju odgovora na zahtjev korisnika model koristi te naučene težine kako bi predvidio i stvorio novi sadržaj.
Koja se vrsta informacija koristi za podučavanje usluge ChatGPT?
Od javno dostupnog internetskog sadržaja koristimo samo informacije kojima se može slobodno i otvoreno pristupiti na internetu. To može uključivati javno dostupne web-stranice, javne forume, javne blogove i objave te drugi javno dostupan sadržaj na internetu. Naprimjer, ako učestvujete u javno dostupnoj internetskoj raspravi ili objavite javni blog ili drugu javnu objavu, taj javno dostupan sadržaj možemo koristiti za treniranje modela. Međutim, poduzimamo mjere kako bismo smanjili obradu ličnih podataka tokom treniranja. Pri prikupljanju javno dostupnog internetskog sadržaja ne prikupljamo namjerno podatke iz izvora zaštićenih naplatom niti s mračnog weba. Osim toga, primjenjujemo filtere za uklanjanje materijala iz kojih ne želimo da naši modeli uče, kao što su govor mržnje, sadržaj za odrasle, stranice koje objedinjuju lične podatke i neželjeni sadržaj. Preostale informacije zatim se koriste za treniranje naših modela.
Vlasnici web-stranica mogu upravljati time može li se javno dostupnom sadržaju s njihovih stranica pristupiti radi treniranja koristeći standardne web-kontrole, kao što je robots.txt, da bi onemogućili GPTBot, koji može indeksirati javno dostupan sadržaj radi treniranja naših modela. Pružamo smjernice kako bismo vlasnicima web-stranica pomogli da upravljaju interakcijom svojih stranica i sadržaja s našim sistemima umjetne inteligencije.
Za treniranje i poboljšavanje naših modela koristimo i informacije partnera koji su treće strane. To može obuhvatati informacije u skupovima podataka kojima pristupamo na osnovu ugovora s trećim stranama, kao i informacije koje pružaju ili stvaraju treneri i istraživači kada je to dopušteno našim pravilima i ugovorima. To pomaže poboljšati kvalitet, sigurnost i performanse naših modela. Ovisno o skupu podataka, ti izvori mogu sadržavati tekst, slike, zvuk, videozapise ili druge vrste podataka.
U nekim procesima treniranja sve više koristimo i sintetičke podatke. Naprimjer, informacije i naše modele možemo koristiti za generiranje sintetičkih upita, višejezičnih primjera ili drugih materijala za treniranje. Sintetički podaci mogu pomoći u poboljšavanju performansi modela, između ostalog dopunjavanjem podataka za treniranje u područjima u kojima su oni oskudni ili neuravnoteženi, a mogu podržati i pristupe razvoju modela koji poboljšavaju privatnost.
Koriste li se lični podaci za podučavanje usluge ChatGPT?
Značajan dio sadržaja na internetu obuhvata informacije o ljudima, pa naši podaci za treniranje mogu slučajno sadržavati lične podatke. Međutim, poduzimamo mjere kako bismo smanjili obradu ličnih podataka tokom treniranja.
Podatke za treniranje koristimo za razvoj sposobnosti modela, kao što su predviđanje, rezonovanje i rješavanje problema, a ne za izradu profila pojedinaca, kontaktiranje s njima ili prilagođavanje oglasa njima.
U nekim slučajevima modeli mogu učiti iz ličnih podataka kako bi razumjeli funkciju elemenata poput imena i adresa u jeziku ili prepoznali javne ličnosti i poznate subjekte. To modelu pomaže da generira tačnije odgovore koji bolje odgovaraju kontekstu.
Kako se lični podaci štite tokom treniranja?
Aktivno poduzimamo mjere za ograničavanje obrade ličnih podataka tokom treniranja. Naprimjer, isključujemo poznate izvore koji objedinjuju velike količine ličnih podataka, primjenjujemo filtriranje kako bismo smanjili količinu ličnih podataka u procesu treniranja te poduzimamo mjere za prepoznavanje i uklanjanje dupliciranog sadržaja kako bismo smanjili rizik od ponavljanja podataka za treniranje. Osim toga, treniramo svoje modele da ne odgovaraju na zahtjeve za privatne ili osjetljive podatke o pojedincima.
Koliko dugo čuvamo informacije
Informacije u podacima za treniranje čuvamo samo onoliko dugo koliko je razumno potrebno za svrhe opisane u ovom članku i našim Pravilima privatnosti, uključujući razvoj i poboljšavanje naših modela te povezane svrhe naučnog istraživanja. Potreba za čuvanjem periodično se preispituje, a period čuvanja razlikuje se ovisno o vrsti informacija i načinu njihove upotrebe. Pri određivanju perioda čuvanja uzimamo u obzir faktore kao što su svrha obrade informacija, njihova količina, priroda i osjetljivost, mogući rizik od štete uslijed neovlaštene upotrebe ili otkrivanja te sve zakonske obaveze koje se na nas odnose.
Kako je razvoj usluge ChatGPT usklađen sa zakonima o privatnosti?
Informacije za treniranje koristimo u skladu sa zakonom. Naši temeljni modeli pokreću širok raspon korisnih aplikacija, uključujući alate za pristupačnost, korisničku podršku, razvoj softvera, personalizirano obrazovanje i naučna istraživanja. Te sposobnosti ovise o podacima za treniranje velikih razmjera, uključujući javno dostupne informacije i informacije partnera koji su treće strane. Tokom cijelog procesa treniranja primjenjujemo zaštitne mjere, uključujući korake osmišljene za smanjenje obrade ličnih podataka i ublažavanje rizika, kao što je opisano u ovom članku. Prikupljanje i korištenje ličnih podataka sadržanih u informacijama za treniranje zasnivamo na legitimnim interesima u skladu sa zakonima o privatnosti poput GDPR-a. To uključuje treniranje i poboljšavanje naših modela za korisnike i šire društvo, u skladu s našom misijom da opća umjetna inteligencija koristi svima, kako je detaljnije objašnjeno u našim Pravilima privatnosti. Proveli smo procjenu utjecaja na zaštitu podataka kako bismo osigurali da ove informacije prikupljamo i koristimo zakonito i odgovorno.
Kada se informacije mogu dijeliti ili prenositi
Ne „prodajemo“ lične podatke i otkrivamo lične podatke iz podataka za treniranje samo u ograničenim okolnostima opisanim u našim Pravilima privatnosti. Naprimjer, informacije možemo dijeliti s povezanim društvima, dobavljačima i pružaocima usluga koji podržavaju razvoj, testiranje i poboljšavanje naših modela. Informacije možemo otkriti i ako u dobroj vjeri smatramo da je to potrebno radi ispunjavanja zakonske obaveze ili zaštite naših prava i sigurnosti te prava i sigurnosti naših korisnika, zaposlenika ili javnosti, kao što je opisano u našim Pravilima privatnosti.
Budući da je naša infrastruktura globalna, lični podaci u podacima za treniranje mogu se obrađivati u zemljama izvan EGP-a, Švicarske ili Ujedinjenog Kraljevstva, uključujući Sjedinjene Američke Države. Kada se to dogodi, primjenjujemo odgovarajuće zaštitne mjere, kao što su odluke o primjerenosti ili standardne ugovorne klauzule, kako je opisano u našim Pravilima privatnosti.
Vaša prava i kako ih ostvariti
Odgovaramo na prigovore i slične zahtjeve za ostvarivanje prava. Budući da uči jezik, ChatGPT u odgovorima ponekad može navesti lične podatke o pojedincima čiji se lični podaci više puta pojavljuju na javnom internetu, kao što su javne ličnosti. Pojedinci u određenim jurisdikcijama mogu putem našeg Portala za privatnost uložiti prigovor na obradu svojih ličnih podataka koju vrše naši modeli ili podnijeti druge zahtjeve za ostvarivanje prava ispitanika. Ta prava možete ostvariti i tako što ćete se obratiti na privacy@openai.com.
Kako biste nam pomogli da procijenimo vaš zahtjev i odgovorimo na njega, navedite dovoljno informacija da možemo razumjeti na koje se lične podatke zahtjev odnosi, kao što su vaše ime, relevantni URL-ovi, konkretni primjeri izlaznih rezultata modela ili drugi detalji koji pomažu utvrditi problem. U nekim slučajevima možemo zatražiti da potvrdite svoj identitet ili da se informacije odnose na vas prije nego što možemo poduzeti mjere. Više informacija o podnošenju tih zahtjeva, uključujući najbolje prakse i način njihovog razmatranja, dostupno je u našem članku Centra za pomoć o uklanjanju ličnih podataka iz usluge ChatGPT. Zahtjeve razmatramo u skladu s primjenjivim zakonima o privatnosti i odgovaramo u zakonski propisanim rokovima.
Imajte na umu da, u skladu sa zakonima o privatnosti, neka prava možda nisu apsolutna. Naprimjer, možda nećemo moći ispuniti zahtjev ako ne možemo provjeriti relevantne informacije, ako se zahtjev ne odnosi na lične podatke koje obrađuje OpenAI, ako se primjenjuje izuzeće ili ako imamo drugi zakonit razlog za to. Zahtjevi se procjenjuju pojedinačno i mogu zahtijevati usklađivanje prava na privatnost s drugim važnim pitanjima, kao što su sloboda izražavanja i javni interes.
Ipak, nastojimo dati prednost zaštiti ličnih podataka i poštovati sve primjenjive zakone o privatnosti. Ako smatrate da nismo na odgovarajući način riješili problem, imate pravo podnijeti pritužbu lokalnom nadzornom tijelu.
Više informacija o praksama kompanije OpenAI u vezi s ličnim podacima koje prikupljamo od vas ili o vama dok koristite našu web-stranicu, aplikacije i usluge potražite u našim Pravilima privatnosti.
