OpenAI-jevi temeljni modeli, uključujući modele na kojima radi ChatGPT, razvijaju se pomoću tri glavna izvora informacija: (1) informacija koje su javno dostupne na internetu, (2) informacija kojima pristupamo u saradnji s trećim stranama i (3) informacija koje naši korisnici, ljudski treneri i istraživači pružaju ili generiraju.
Razvoj temeljnih modela poput onih koji se koriste u ChatGPT-u obuhvata nekoliko faza, uključujući pripremu podataka za treniranje, predobuku i naknadnu obuku, kao i stalnu evaluaciju i unapređivanje nakon implementacije. U tim fazama mogu se koristiti različite vrste informacija za razne svrhe, uključujući poboljšanje performansi, pouzdanosti i sigurnosti modela.
Ovaj članak daje pregled informacija koje koristimo za razvoj tih modela, načina na koji prikupljamo i koristimo te informacije u skladu sa zakonima o privatnosti te zaštitnih mjera koje primjenjujemo tokom cijelog procesa treniranja. Da biste razumjeli kako prikupljamo i koristimo informacije od korisnika naših usluga, uključujući način da isključite korištenje razgovora u ChatGPT-u za poboljšanje naših modela, pogledajte naša Pravila privatnosti i ovaj članak u centru za pomoć.
Šta je ChatGPT i kako funkcionira?
ChatGPT je usluga zasnovana na umjetnoj inteligenciji kojoj možete pristupiti putem interneta ili aplikacije. ChatGPT možete koristiti za širok raspon zadataka, uključujući organiziranje i sažimanje informacija, pomoć pri prevođenju, podršku u kodiranju, istraživanju i analizi, izvršavanje zadataka u više koraka kroz različite alate, analiziranje ili generiranje slika, poticanje kreativnosti i ideja te druge svakodnevne aktivnosti. ChatGPT je osmišljen da razumije pitanja i upute korisnika i odgovara na njih učeći obrasce iz velikih količina informacija, uključujući tekst, slike, zvuk i video.
Tokom treniranja model analizira odnose unutar tih podataka — na primjer kako se riječi obično pojavljuju zajedno u kontekstu — i koristi to razumijevanje da predvidi sljedeću najvjerovatniju riječ pri generiranju odgovora, riječ po riječ. Tekst se može pretvoriti u manje jedinice, koje se ponekad nazivaju „tokeni” i mogu predstavljati cijele riječi, dijelove riječi ili interpunkciju. Tokeni su osnovni gradivni elementi teksta koje model obrađuje. Slično tome, modeli koji generiraju druge oblike sadržaja, poput slika, uče obrasce u tome kako su pikseli međusobno povezani i povezani s pripadajućim opisima u podacima za treniranje.
Naprimjer, tokom procesa učenja modela (poznatog kao „treniranje”), model može dobiti zadatak da dovrši rečenicu poput: „Umjesto da skrene lijevo, skrenula je ___.” Na početku treniranja njegovi odgovori su uglavnom nasumični. Međutim, kako model obrađuje i uči iz velike količine teksta, postaje bolji u prepoznavanju obrazaca i predviđanju najvjerovatnije sljedeće riječi. Taj se proces ponavlja na milionima rečenica kako bi se izoštrilo njegovo razumijevanje i poboljšala tačnost.
Budući da postoji više mogućih načina da se rečenica dovrši — na primjer „Umjesto da skrene lijevo, skrenula je desno”, „u krug” ili „nazad” — u načinu na koji model odgovara postoji prirodan element nasumičnosti. Zbog toga isto pitanje može dati različite odgovore u različitim upitima.
Modeli mašinskog učenja sastoje se od velikih skupova brojeva, poznatih kao „težine” ili „parametri”, zajedno s kodom koji tumači i koristi te brojeve. Ti modeli ne pohranjuju niti zadržavaju kopije podataka na kojima su trenirani. Umjesto toga, kako model uči, vrijednosti njegovih parametara blago se prilagođavaju kako bi odražavale obrasce koje je prepoznao. U ranijem primjeru model je napredovao od predviđanja nasumičnih riječi do tačnijih predviđanja — ne pohranjivanjem rečenica za treniranje, već ažuriranjem svojih internih parametara. Model ne zadržava kopije rečenica, slika ili zvuka koje obrađuje tokom treniranja. ChatGPT ne „kopira i lijepi” iz svojih podataka za treniranje — slično kao što nastavnik, nakon opsežnog učenja, može objasniti koncepte razumijevanjem odnosa među idejama bez pamćenja ili doslovnog reproduciranja izvornih materijala. Kada generira odgovor na korisnički zahtjev, model koristi te naučene težine da predvidi i stvori novi sadržaj.
Koja vrsta informacija se koristi za podučavanje ChatGPT-a?
Za javno dostupan internetski sadržaj koristimo samo informacije koje su slobodno i otvoreno dostupne na internetu. To može uključivati javno dostupne web stranice, javne forume, javne blogove, javne objave i drugi javno dostupan online sadržaj. Naprimjer, ako učestvujete u javno dostupnom online forumu za raspravu ili objavite javni blog ili drugu objavu, taj javno dostupan sadržaj možemo koristiti u svrhe treniranja modela. Međutim, poduzimamo korake za smanjenje obrade ličnih podataka u našem procesu treniranja. Pri prikupljanju javno dostupnog internetskog sadržaja ne prikupljamo namjerno podatke iz izvora za koje je poznato da su iza platnih zidova niti s dark weba. Osim toga, primjenjujemo filtere za uklanjanje materijala iz kojih ne želimo da naši modeli uče, kao što su govor mržnje, sadržaj za odrasle, stranice koje prikupljaju lične podatke i neželjena pošta. Preostale informacije se zatim koriste za treniranje naših modela.
Vlasnici web stranica mogu upravljati time hoće li javno dostupan sadržaj s njihovih stranica biti dostupan za korištenje u treniranju pomoću standardnih web kontrola kao što je robots.txt, kako bi zabranili GPTBot, koji može indeksirati javno dostupan sadržaj radi pomoći u treniranju naših modela. Pružamo smjernice kako bismo vlasnicima web stranica pomogli da upravljaju načinom na koji njihove stranice i sadržaj stupaju u interakciju s našim AI sistemima.
Također koristimo informacije od partnera trećih strana kako bismo pomogli u treniranju i poboljšanju naših modela. To može uključivati informacije u skupovima podataka kojima pristupamo putem ugovora s trećim stranama, kao i informacije koje pružaju ili generiraju ljudski treneri i istraživači kada je to dozvoljeno našim pravilima i ugovorima. To pomaže u poboljšanju kvaliteta, sigurnosti i performansi naših modela. Ti izvori mogu uključivati tekst, slike, zvuk, video ili druge vrste podataka, zavisno od skupa podataka.
Također sve više koristimo sintetičke podatke u nekim procesima treniranja. Naprimjer, možemo koristiti informacije i naše modele za generiranje sintetičkih upita, višejezičnih primjera ili drugih materijala za treniranje. Sintetički podaci mogu pomoći u poboljšanju performansi modela, između ostalog dopunjavanjem podataka za treniranje u područjima gdje su podaci oskudni ili neuravnoteženi, a mogu podržati i pristupe razvoju modela koji unapređuju privatnost.
Koriste li se lični podaci za podučavanje ChatGPT-a?
Značajan dio online sadržaja uključuje informacije o ljudima, pa naši podaci za treniranje mogu slučajno sadržavati lične podatke. Međutim, poduzimamo korake za smanjenje obrade ličnih podataka u našem procesu treniranja.
Podatke za treniranje koristimo za razvoj sposobnosti modela — kao što su predviđanje, rezonovanje i rješavanje problema — a ne za izradu profila pojedinaca, kontaktiranje s njima ili personaliziranje oglasa za njih.
U nekim slučajevima modeli mogu učiti iz ličnih podataka kako bi razumjeli kako elementi poput imena i adresa funkcioniraju u jeziku ili kako bi prepoznali javne osobe i poznate subjekte. To pomaže modelu da generira tačnije i kontekstualno prikladnije odgovore.
Kako se lični podaci štite tokom treniranja?
Poduzimamo aktivne korake da ograničimo obradu ličnih podataka tokom treniranja. Naprimjer, isključujemo poznate izvore koji prikupljaju velike količine ličnih podataka, primjenjujemo filtriranje kako bismo smanjili količinu ličnih podataka u procesu treniranja i poduzimamo korake za prepoznavanje i uklanjanje dupliciranog sadržaja kako bismo smanjili rizik od ponavljanja podataka za treniranje. Osim toga, treniramo naše modele da izbjegavaju odgovaranje na zahtjeve za privatnim ili osjetljivim informacijama o pojedincima.
Koliko dugo zadržavamo informacije
Informacije u podacima za treniranje zadržavamo samo onoliko dugo koliko je razumno potrebno za svrhe opisane u ovom članku i našim Pravilima privatnosti, uključujući razvoj i poboljšanje naših modela te povezane svrhe naučnog istraživanja. Zadržavanje podliježe periodičnom pregledu kako bi se osiguralo da je i dalje neophodno, a razlikuje se zavisno od vrste informacija i načina na koji se koriste. Pri određivanju zadržavanja uzimamo u obzir faktore kao što su naša svrha obrade informacija, količina, priroda i osjetljivost informacija, potencijalni rizik od štete zbog neovlaštene upotrebe ili otkrivanja te sve zakonske obaveze kojima podliježemo.
Kako je razvoj ChatGPT-a usklađen sa zakonima o privatnosti?
Informacije za treniranje koristimo zakonito. Naši temeljni modeli pokreću širok raspon korisnih primjena — uključujući alate za pristupačnost, korisničku podršku, razvoj softvera, personalizirano obrazovanje i naučna istraživanja. Te sposobnosti zavise od velikih količina podataka za treniranje, uključujući javno dostupne informacije i informacije od partnera trećih strana. Primjenjujemo zaštitne mjere tokom cijelog procesa treniranja, uključujući korake osmišljene za smanjenje obrade ličnih podataka u procesu treniranja i ublažavanje rizika, kako je opisano u ovom članku. Naše prikupljanje i korištenje ličnih podataka uključenih u informacije za treniranje zasnivamo na legitimnim interesima prema zakonima o privatnosti kao što je GDPR, uključujući treniranje i poboljšavanje naših modela za korisnike i šire društvo u skladu s našom misijom da opća umjetna inteligencija koristi svima, kako je detaljnije objašnjeno u našim Pravilima privatnosti. Proveli smo procjenu uticaja na zaštitu podataka kako bismo osigurali da te informacije prikupljamo i koristimo zakonito i odgovorno.
Kada se informacije mogu dijeliti ili prenositi
Ne „prodajemo” lične podatke i otkrivamo lične podatke u podacima za treniranje samo u ograničenim okolnostima opisanim u našim Pravilima privatnosti. Naprimjer, informacije možemo dijeliti s povezanim društvima, dobavljačima i pružaocima usluga koji podržavaju razvoj, testiranje i poboljšanje naših modela. Informacije također možemo otkriti ako u dobroj vjeri smatramo da je takva radnja potrebna radi poštivanja zakonske obaveze ili zaštite naših prava, sigurnosti i zaštite, kao i prava, sigurnosti i zaštite naših korisnika, zaposlenika ili javnosti, kako je opisano u našim Pravilima privatnosti.
Budući da je naša infrastruktura globalna, lični podaci u podacima za treniranje mogu se obrađivati u zemljama izvan EEA, Švicarske ili Ujedinjenog Kraljevstva (uključujući Sjedinjene Američke Države). Kada se to dogodi, primjenjujemo odgovarajuće zaštitne mjere, kao što su odluke o adekvatnosti ili standardne ugovorne klauzule, kako je opisano u našim Pravilima privatnosti.
Vaša prava i kako ih ostvariti
Odgovaramo na zahtjeve za prigovor i slične zahtjeve za ostvarivanje prava. Kao rezultat učenja jezika, odgovori ChatGPT-a ponekad mogu sadržavati lične podatke o pojedincima čiji se lični podaci više puta pojavljuju na javnom internetu (naprimjer, javne osobe). Pojedinci u određenim jurisdikcijama mogu prigovoriti obradi svojih ličnih podataka od strane naših modela ili podnijeti druge zahtjeve za ostvarivanje prava ispitanika putem našeg Portala za privatnost. Ta prava možete ostvariti i slanjem poruke na privacy@openai.com.
Kako biste nam pomogli da procijenimo vaš zahtjev i odgovorimo na njega, navedite dovoljno informacija da možemo razumjeti na koje se lične podatke vaš zahtjev odnosi, kao što su vaše ime, relevantni URL-ovi, konkretni primjeri izlaza modela ili drugi detalji koji pomažu u prepoznavanju problema. U nekim slučajevima možemo zatražiti da potvrdite svoj identitet ili da potvrdite da se informacije odnose na vas prije nego što možemo poduzeti radnju. Više informacija o tome kako podnijeti ove zahtjeve, uključujući najbolje prakse i način pregleda zahtjeva, dostupno je u našem članku u Centru za pomoć o uklanjanju ličnih podataka iz ChatGPT-a. Zahtjeve pregledamo u skladu s primjenjivim zakonima o privatnosti i odgovaramo u važećim zakonskim rokovima.
Imajte na umu da, u skladu sa zakonima o privatnosti, neka prava možda nisu apsolutna. Naprimjer, možda nećemo moći ispuniti zahtjev ako ne možemo provjeriti relevantne informacije, ako se zahtjev ne odnosi na lične podatke koje obrađuje OpenAI, ako se primjenjuje izuzeće ili ako za to imamo drugi zakonit razlog. Zahtjevi se procjenjuju od slučaja do slučaja i mogu uključivati odmjeravanje prava na privatnost u odnosu na druge važne aspekte, kao što su sloboda izražavanja i javni interes.
Međutim, nastojimo dati prednost zaštiti ličnih podataka i poštovati sve primjenjive zakone o privatnosti. Ako smatrate da nismo adekvatno riješili neki problem, imate pravo podnijeti pritužbu svom lokalnom nadzornom tijelu.
Za više informacija o OpenAI-jevim praksama u vezi s ličnim podacima koje prikupljamo od vas ili o vama kada koristite našu web stranicu, aplikacije i usluge, pogledajte naša Pravila privatnosti.
