Temeljni modeli OpenAI, vključno z modeli, ki poganjajo ChatGPT, se razvijajo z uporabo treh glavnih virov informacij: (1) javno dostopnih informacij na internetu, (2) informacij, do katerih dostopamo v sodelovanju s tretjimi osebami, in (3) informacij, ki jih zagotovijo ali ustvarijo naši uporabniki, človeški izvajalci učenja in raziskovalci.
Razvoj temeljnih modelov, kot so tisti, ki se uporabljajo v ChatGPT, obsega več faz, med drugim pripravo učnih podatkov, začetno usposabljanje in naknadno usposabljanje ter stalno ocenjevanje in izboljševanje po uvedbi. V teh fazah se lahko za različne namene uporabljajo različne vrste informacij, med drugim za izboljšanje učinkovitosti, zanesljivosti in varnosti modelov.
Ta članek ponuja pregled informacij, ki jih uporabljamo pri razvoju teh modelov, načina njihovega zbiranja in uporabe v skladu z zakonodajo o zasebnosti ter zaščitnih ukrepov, ki jih izvajamo skozi celoten postopek učenja. Če želite izvedeti, kako zbiramo in uporabljamo informacije uporabnikov naših storitev, vključno s tem, kako lahko preprečite uporabo pogovorov v ChatGPT za izboljšanje naših modelov, si oglejte naš pravilnik o zasebnosti in ta članek Centra za pomoč.
Kaj je ChatGPT in kako deluje?
ChatGPT je storitev na podlagi umetne inteligence, do katere lahko dostopate prek interneta ali aplikacije. ChatGPT lahko uporabljate za najrazličnejša opravila, med drugim za urejanje in povzemanje informacij, pomoč pri prevajanju, programiranju, raziskovanju in analizi, izvajanje večstopenjskih opravil z različnimi orodji, analizo ali ustvarjanje slik, spodbujanje ustvarjalnosti in iskanje zamisli ter druge vsakodnevne dejavnosti. ChatGPT je zasnovan tako, da razume vprašanja in navodila uporabnikov ter se nanje odziva, saj se uči vzorcev iz velike količine informacij, vključno z besedilom, slikami, zvokom in videom.
Med učenjem model analizira odnose v teh podatkih, na primer kako se besede običajno pojavljajo skupaj v določenem kontekstu, in to razumevanje uporabi, da pri ustvarjanju odgovora besedo za besedo napoveduje naslednjo najverjetnejšo besedo. Besedilo se lahko pretvori v manjše enote, včasih imenovane »žetoni«, ki lahko predstavljajo cele besede, dele besed ali ločila. Žetoni so gradniki besedila, ki ga obdeluje model. Podobno se modeli, ki ustvarjajo druge oblike vsebine, kot so slike, učijo vzorcev v odnosih med slikovnimi pikami in med njimi ter pripadajočimi opisi v učnih podatkih.
Med procesom učenja modela (imenovanim »učenje«) lahko model na primer dobi nalogo, naj dokonča stavek: »Namesto da bi zavila levo, je zavila ___.« Na začetku učenja so njegovi odgovori večinoma naključni. Ko pa model obdela veliko količino besedila in se iz nje uči, vse bolje prepoznava vzorce ter napoveduje najverjetnejšo naslednjo besedo. Ta postopek se ponovi na milijonih stavkov, da model izpopolni svoje razumevanje in izboljša natančnost.
Ker je stavek mogoče smiselno dokončati na več načinov, na primer »Namesto da bi zavila levo, je zavila desno«, »naokrog« ali »nazaj«, je v odzivih modela neizogibno prisotna določena mera naključnosti. Zato lahko isto vprašanje ob različnih poizvedbah prinese različne odgovore.
Modeli strojnega učenja so sestavljeni iz velikih zbirk števil, imenovanih »uteži« ali »parametri«, in kode, ki ta števila razlaga ter uporablja. Ti modeli ne shranjujejo ali hranijo kopij podatkov, na katerih se učijo. Namesto tega se med učenjem modela vrednosti njegovih parametrov nekoliko prilagajajo, da odražajo prepoznane vzorce. V prejšnjem primeru je model od napovedovanja naključnih besed napredoval do natančnejših napovedi, vendar ne s shranjevanjem učnih stavkov, temveč s posodabljanjem svojih notranjih parametrov. Model ne hrani kopij stavkov, slik ali zvoka, ki jih obdeluje med učenjem. ChatGPT podatkov za učenje ne »kopira in prilepi«. Podobno lahko učitelj po obsežnem študiju pojasni pojme, ker razume odnose med zamislimi, ne da bi si izvirno gradivo zapomnil ali ga dobesedno ponavljal. Ko model ustvari odgovor na zahtevo uporabnika, te naučene uteži uporabi za napovedovanje in ustvarjanje nove vsebine.
Katere vrste informacij se uporabljajo za učenje ChatGPT?
Od javno dostopnih internetnih vsebin uporabljamo samo informacije, ki so na internetu prosto in odprto dostopne. To lahko vključuje javno dostopne spletne strani, javne forume, javne spletne dnevnike, javne objave in druge javno dostopne spletne vsebine. Če na primer sodelujete v javno dostopnem spletnem razpravnem forumu ali objavite javni spletni dnevnik oziroma drugo javno objavo, lahko to javno dostopno vsebino uporabimo za učenje modelov. Vendar izvajamo ukrepe za zmanjšanje obdelave osebnih podatkov v postopku učenja. Pri zbiranju javno dostopnih internetnih vsebin podatkov ne pridobivamo namenoma iz virov, za katere je znano, da so plačljivi, ali s temnega spleta. Poleg tega uporabljamo filtre za odstranjevanje gradiva, iz katerega ne želimo učiti svojih modelov, kot so sovražni govor, vsebine za odrasle, spletna mesta, ki zbirajo osebne podatke, in neželena vsebina. Preostale informacije nato uporabimo za učenje svojih modelov.
Lastniki spletnih mest lahko s standardnimi spletnimi kontrolniki, kot je robots.txt, določijo, ali se sme do javno dostopnih vsebin z njihovih mest dostopati za namene učenja. Tako lahko onemogočijo GPTBot, ki lahko preiskuje javno dostopne vsebine za pomoč pri učenju naših modelov. Lastnikom spletnih mest ponujamo navodila za upravljanje interakcij njihovih mest in vsebin z našimi sistemi umetne inteligence.
Pri učenju in izboljševanju svojih modelov uporabljamo tudi informacije partnerjev, ki so tretje osebe. To lahko vključuje informacije v podatkovnih zbirkah, do katerih dostopamo na podlagi dogovorov s tretjimi osebami, ter informacije, ki jih zagotovijo ali ustvarijo človeški izvajalci učenja in raziskovalci, kadar to dovoljujejo naši pravilniki in dogovori. To pomaga izboljšati kakovost, varnost in učinkovitost naših modelov. Ti viri lahko glede na podatkovno zbirko vključujejo besedilo, slike, zvok, video ali druge vrste podatkov.
V nekaterih postopkih učenja vse pogosteje uporabljamo tudi sintetične podatke. Informacije in svoje modele lahko na primer uporabimo za ustvarjanje sintetičnih pozivov, večjezičnih primerov ali drugega učnega gradiva. Sintetični podatki lahko izboljšajo učinkovitost modela, med drugim tako, da dopolnijo učne podatke na področjih, kjer jih je malo ali so neuravnoteženi, podpirajo pa lahko tudi pristope k razvoju modelov, ki bolje varujejo zasebnost.
Ali se za učenje ChatGPT uporabljajo osebni podatki?
Velik del spletnih vsebin vsebuje informacije o ljudeh, zato so lahko osebni podatki nenamerno vključeni tudi v naše učne podatke. Vendar izvajamo ukrepe za zmanjšanje obdelave osebnih podatkov v postopku učenja.
Učne podatke uporabljamo za razvoj zmogljivosti modela, kot so napovedovanje, sklepanje in reševanje problemov, ne pa za ustvarjanje profilov posameznikov, vzpostavljanje stika z njimi ali prilagajanje oglasov zanje.
V nekaterih primerih se lahko modeli iz osebnih podatkov učijo, kako se elementi, kot so imena in naslovi, uporabljajo v jeziku, ali kako prepoznati javne osebnosti in splošno znane subjekte. To modelu pomaga ustvarjati natančnejše in kontekstu primernejše odgovore.
Kako so osebni podatki zaščiteni med učenjem?
Dejavno izvajamo ukrepe za omejitev obdelave osebnih podatkov med učenjem. Izključujemo na primer znane vire, ki zbirajo velike količine osebnih podatkov, uporabljamo filtre za zmanjšanje količine osebnih podatkov v postopku učenja ter prepoznavamo in odstranjujemo podvojeno vsebino, da zmanjšamo tveganje ponavljanja učnih podatkov. Poleg tega svoje modele učimo, naj ne odgovarjajo na zahteve po zasebnih ali občutljivih podatkih o posameznikih.
Kako dolgo hranimo informacije
Informacije v učnih podatkih hranimo le toliko časa, kolikor je razumno potrebno za namene, opisane v tem članku in našem pravilniku o zasebnosti, vključno z razvojem in izboljševanjem naših modelov ter povezanimi znanstvenoraziskovalnimi nameni. Potrebo po hrambi redno preverjamo, trajanje hrambe pa se razlikuje glede na vrsto informacij in način njihove uporabe. Pri določanju obdobja hrambe upoštevamo dejavnike, kot so namen obdelave informacij, njihova količina, narava in občutljivost, morebitno tveganje škode zaradi nepooblaščene uporabe ali razkritja ter vse veljavne pravne obveznosti.
Kako je razvoj ChatGPT skladen z zakonodajo o zasebnosti?
Informacije za učenje uporabljamo zakonito. Naši temeljni modeli poganjajo številne koristne aplikacije, med drugim orodja za dostopnost, podporo strankam, razvoj programske opreme, prilagojeno izobraževanje in znanstvene raziskave. Te zmogljivosti so odvisne od obsežnih učnih podatkov, vključno z javno dostopnimi informacijami in informacijami partnerjev, ki so tretje osebe. V celotnem postopku učenja izvajamo zaščitne ukrepe, vključno z ukrepi za zmanjšanje obdelave osebnih podatkov med učenjem in omejevanje tveganj, kot je opisano v tem članku. Zbiranje in uporabo osebnih podatkov, vključenih v informacije za učenje, utemeljujemo z zakonitimi interesi po zakonodaji o zasebnosti, kot je GDPR. To vključuje učenje in izboljševanje naših modelov za uporabnike in širšo družbo v skladu z našim poslanstvom zagotoviti, da splošna umetna inteligenca koristi vsem, kot je podrobneje pojasnjeno v našem pravilniku o zasebnosti. Izvedli smo oceno učinka v zvezi z varstvom podatkov, da bi zagotovili zakonito in odgovorno zbiranje ter uporabo teh informacij.
Kdaj se lahko informacije delijo ali prenesejo
Osebnih podatkov ne »prodajamo«, osebne podatke v učnih podatkih pa razkrivamo le v omejenih okoliščinah, opisanih v našem pravilniku o zasebnosti. Informacije lahko na primer delimo s povezanimi družbami, dobavitelji in ponudniki storitev, ki podpirajo razvoj, preizkušanje in izboljševanje naših modelov. Informacije lahko razkrijemo tudi, če v dobri veri menimo, da je to potrebno za izpolnitev pravne obveznosti ali zaščito naših pravic, varnosti in zaščite oziroma pravic, varnosti in zaščite naših uporabnikov, zaposlenih ali javnosti, kot je opisano v našem pravilniku o zasebnosti.
Ker je naša infrastruktura globalna, se lahko osebni podatki v učnih podatkih obdelujejo v državah zunaj EGP, Švice ali Združenega kraljestva, tudi v Združenih državah Amerike. V takih primerih izvajamo ustrezne zaščitne ukrepe, kot so sklepi o ustreznosti ali standardne pogodbene klavzule, kot je opisano v našem pravilniku o zasebnosti.
Vaše pravice in kako jih uveljavljati
Odzivamo se na ugovore in podobne zahteve za uveljavljanje pravic. Ker se ChatGPT uči jezika, lahko njegovi odgovori včasih vključujejo osebne podatke o posameznikih, katerih osebni podatki se večkrat pojavijo na javnem internetu, na primer o javnih osebnostih. Posamezniki v nekaterih jurisdikcijah lahko prek našega Portala zasebnosti ugovarjajo obdelavi svojih osebnih podatkov v naših modelih ali vložijo druge zahteve za uveljavljanje pravic posameznikov, na katere se nanašajo osebni podatki. Te pravice lahko uveljavljate tudi tako, da pišete na privacy@openai.com.
Da bomo lahko ocenili vašo zahtevo in se nanjo odzvali, navedite dovolj informacij, da bomo razumeli, na katere osebne podatke se nanaša, na primer svoje ime, ustrezne spletne naslove, konkretne primere izhodnih podatkov modela ali druge podrobnosti, ki pomagajo opredeliti težavo. V nekaterih primerih vas bomo morda pred ukrepanjem prosili, da potrdite svojo identiteto ali da se informacije nanašajo na vas. Več informacij o vložitvi teh zahtev, vključno s priporočenimi postopki in načinom njihove obravnave, je na voljo v našem članku Centra za pomoč o odstranjevanju osebnih podatkov iz ChatGPT. Zahteve obravnavamo v skladu z veljavno zakonodajo o zasebnosti in nanje odgovorimo v veljavnih zakonskih rokih.
Upoštevajte, da nekatere pravice v skladu z zakonodajo o zasebnosti morda niso absolutne. Zahtevi na primer morda ne bomo mogli ugoditi, če ne moremo preveriti zadevnih informacij, če se ne nanaša na osebne podatke, ki jih obdeluje OpenAI, če velja izjema ali če imamo za to drug zakonit razlog. Zahteve ocenjujemo za vsak primer posebej, pri tem pa je lahko treba pravice do zasebnosti uravnotežiti z drugimi pomembnimi vidiki, kot sta svoboda izražanja in javni interes.
Kljub temu si prizadevamo dati prednost varstvu osebnih podatkov in spoštovati vso veljavno zakonodajo o zasebnosti. Če menite, da težave nismo ustrezno obravnavali, imate pravico vložiti pritožbo pri svojem krajevno pristojnem nadzornem organu.
Za več informacij o ravnanju družbe OpenAI z osebnimi podatki, ki jih zbiramo od vas ali o vas, ko uporabljate naše spletno mesto, aplikacije in storitve, si oglejte naš pravilnik o zasebnosti.
