OpenAI
Ta stran je bila strojno prevedena. Oglejte si izvirni članek v angleščini.

Kako razvijamo ChatGPT in naše temeljne modele

Preberite več o tem, kako razvijamo svoje modele in jih uporabljamo v izdelkih, kot je ChatGPT

Posodobljeno: 8 days ago

OpenAI-jevi temeljni modeli, vključno z modeli, ki poganjajo ChatGPT, se razvijajo z uporabo treh glavnih virov informacij: (1) informacij, ki so javno dostopne na internetu, (2) informacij, do katerih dostopamo v sodelovanju s tretjimi osebami, in (3) informacij, ki jih zagotovijo ali ustvarijo naši uporabniki, človeški učitelji in raziskovalci.

Razvoj temeljnih modelov, kot so tisti, ki se uporabljajo v ChatGPT-ju, vključuje več faz, med drugim pripravo podatkov za usposabljanje, začetno usposabljanje in nadaljnje usposabljanje, pa tudi stalno ocenjevanje in izboljševanje po uvedbi. V teh fazah se lahko za različne namene uporabljajo različne vrste informacij, med drugim za izboljšanje zmogljivosti, zanesljivosti in varnosti modela. 

Ta članek podaja pregled informacij, ki jih uporabljamo pri razvoju teh modelov, načina, kako te informacije zbiramo in uporabljamo skladno z zakoni o zasebnosti, ter zaščitnih ukrepov, ki jih uporabljamo v celotnem procesu usposabljanja. Če želite razumeti, kako zbiramo in uporabljamo informacije uporabnikov naših storitev, vključno s tem, kako lahko zavrnete uporabo pogovorov v ChatGPT-ju za izboljšanje naših modelov, si oglejte naš Pravilnik o zasebnosti in ta članek v centru za pomoč.

Kaj je ChatGPT in kako deluje?

ChatGPT je storitev, ki temelji na umetni inteligenci in do katere lahko dostopate prek interneta ali aplikacije. ChatGPT lahko uporabljate za širok nabor nalog, med drugim za urejanje in povzemanje informacij, pomoč pri prevajanju, podporo pri programiranju, raziskovanju in analizi, izvajanje večstopenjskih nalog v različnih orodjih, analiziranje ali ustvarjanje slik, spodbujanje ustvarjalnosti in idej ter druge vsakodnevne dejavnosti. ChatGPT je zasnovan tako, da razume vprašanja in navodila uporabnikov ter se nanje odziva z učenjem vzorcev iz velikih količin informacij, vključno z besedilom, slikami, zvokom in videom. 

Med usposabljanjem model analizira razmerja v teh podatkih, na primer kako se besede običajno pojavljajo skupaj v kontekstu, in to razumevanje uporablja za napovedovanje najverjetnejše naslednje besede pri ustvarjanju odgovora, besedo za besedo. Besedilo se lahko pretvori v manjše enote, včasih imenovane »žetoni«, ki lahko predstavljajo cele besede, dele besed ali ločila. Žetoni so gradniki besedila, ki jih model obdeluje. Podobno se modeli, ki ustvarjajo druge oblike vsebine, na primer slike, učijo vzorcev v tem, kako so slikovne pike povezane med seboj in s pripadajočimi napisi v podatkih za usposabljanje.

Na primer, med procesom učenja modela (znanim kot »usposabljanje«) bi lahko model dobil nalogo dokončati stavek, kot je: »Namesto da bi zavila levo, je zavila ___«. Na začetku usposabljanja so njegovi odgovori večinoma naključni. Ko pa model obdeluje veliko količino besedila in se iz nje uči, postaja boljši pri prepoznavanju vzorcev in napovedovanju najverjetnejše naslednje besede. Ta proces se ponavlja na milijonih stavkov, da se izostri njegovo razumevanje in izboljša njegova natančnost.

Ker obstaja več verjetnih načinov za dokončanje stavka, na primer »Namesto da bi zavila levo, je zavila desno«, »naokoli« ali »nazaj«, je v načinu odzivanja modela prisoten notranji element naključnosti. Zato lahko isto vprašanje pri različnih poizvedbah privede do različnih odgovorov.

Modeli strojnega učenja so sestavljeni iz velikih nizov števil, znanih kot »uteži« ali »parametri«, ter kode, ki ta števila razlaga in uporablja. Ti modeli ne shranjujejo ali hranijo kopij podatkov, na katerih so usposobljeni. Namesto tega se med učenjem modela vrednosti njegovih parametrov nekoliko prilagajajo, da odražajo vzorce, ki jih je prepoznal. V prejšnjem primeru se je model izboljšal od napovedovanja naključnih besed do natančnejših napovedi, ne tako, da bi shranjeval stavke za usposabljanje, temveč tako, da je posodabljal svoje notranje parametre. Model ne hrani kopij stavkov, slik ali zvoka, ki jih obdela med usposabljanjem. ChatGPT iz svojih podatkov za usposabljanje ne »kopira in lepi«; podobno kot lahko učitelj po obsežnem študiju razlaga pojme z razumevanjem razmerij med idejami, ne da bi si izvirno gradivo zapomnil ali ga dobesedno ponavljal. Ko model ustvarja odgovor na uporabnikovo zahtevo, uporablja te naučene uteži za napovedovanje in ustvarjanje nove vsebine.

Kakšne vrste informacij se uporabljajo za učenje ChatGPT-ja?

Pri javno dostopni internetni vsebini uporabljamo samo informacije, ki so prosto in odprto dostopne na internetu. To lahko vključuje javno dostopne spletne strani, javne forume, javne bloge, javne objave in drugo javno dostopno spletno vsebino. Če na primer sodelujete v javno dostopnem spletnem razpravnem forumu ali objavite javni blog oziroma drugo objavo, lahko to javno dostopno vsebino uporabimo za namene usposabljanja modelov. Vendar sprejemamo ukrepe za zmanjšanje obdelave osebnih podatkov v našem procesu usposabljanja.  Pri zbiranju javno dostopne internetne vsebine namerno ne zbiramo podatkov iz virov, za katere je znano, da so za plačilnimi zidovi, ali iz temnega spleta. Poleg tega uporabljamo filtre za odstranjevanje gradiva, za katerega ne želimo, da bi se ga naši modeli učili, kot so sovražni govor, vsebine za odrasle, spletna mesta, ki združujejo osebne podatke, in neželena vsebina. Preostale informacije se nato uporabijo za usposabljanje naših modelov. 

Lastniki spletnih mest lahko upravljajo, ali je do javno dostopne vsebine z njihovih mest mogoče dostopati za uporabo pri usposabljanju, tako da s standardnimi spletnimi kontrolami, kot je robots.txt, onemogočijo GPTBot, ki lahko preiskuje javno dostopno vsebino za pomoč pri usposabljanju naših modelov. Zagotavljamo smernice, ki lastnikom spletnih mest pomagajo upravljati, kako njihova mesta in vsebine delujejo z našimi sistemi umetne inteligence. 

Za usposabljanje in izboljševanje naših modelov uporabljamo tudi informacije partnerjev tretjih oseb. To lahko vključuje informacije v naborih podatkov, do katerih dostopamo na podlagi dogovorov s tretjimi osebami, ter informacije, ki jih zagotovijo ali ustvarijo človeški učitelji in raziskovalci, kadar je to dovoljeno v skladu z našimi pravilniki in dogovori. To pomaga izboljšati kakovost, varnost in zmogljivost naših modelov. Ti viri lahko vključujejo besedilo, slike, zvok, video ali druge vrste podatkov, odvisno od nabora podatkov.

V nekaterih procesih usposabljanja vse pogosteje uporabljamo tudi sintetične podatke. Na primer, za ustvarjanje sintetičnih pozivov, večjezičnih primerov ali drugega gradiva za usposabljanje lahko uporabimo informacije in naše modele. Sintetični podatki lahko pomagajo izboljšati zmogljivost modela, med drugim z dopolnjevanjem podatkov za usposabljanje na področjih, kjer jih je malo ali so neuravnoteženi, ter lahko podpirajo pristope k razvoju modelov, ki krepijo zasebnost.

Ali se osebni podatki uporabljajo za učenje ChatGPT-ja?

Pomemben del spletne vsebine vključuje informacije o ljudeh, zato lahko naši podatki za usposabljanje nenamerno vsebujejo osebne podatke. Vendar sprejemamo ukrepe za zmanjšanje obdelave osebnih podatkov v našem procesu usposabljanja.

Podatke za usposabljanje uporabljamo za razvoj zmožnosti modela, kot so napovedovanje, sklepanje in reševanje problemov, ne pa za ustvarjanje profilov posameznikov, vzpostavljanje stika z njimi ali prilagajanje oglasov zanje.

V nekaterih primerih se lahko modeli učijo iz osebnih podatkov, da razumejo, kako v jeziku delujejo elementi, kot so imena in naslovi, ali da prepoznajo javne osebnosti in dobro znane subjekte. To modelu pomaga ustvarjati natančnejše in kontekstu primernejše odgovore.

Kako so osebni podatki zaščiteni med usposabljanjem?

Aktivno ukrepamo, da omejimo obdelavo osebnih podatkov med usposabljanjem. Na primer, izključujemo znane vire, ki združujejo velike količine osebnih podatkov, uporabljamo filtriranje za zmanjšanje osebnih podatkov v procesu usposabljanja ter sprejemamo ukrepe za prepoznavanje in odstranjevanje podvojene vsebine, da zmanjšamo tveganje ponavljanja podatkov za usposabljanje. Poleg tega naše modele usposabljamo, da se izogibajo odgovarjanju na zahteve po zasebnih ali občutljivih informacijah o posameznikih. 

Kako dolgo hranimo informacije

Informacije v podatkih za usposabljanje hranimo le toliko časa, kolikor je razumno potrebno za namene, opisane v tem članku in našem Pravilniku o zasebnosti, vključno z razvojem in izboljševanjem naših modelov ter za povezane namene znanstvenega raziskovanja. Hramba je predmet rednih pregledov, s katerimi zagotavljamo njeno nadaljnjo potrebnost, in se razlikuje glede na vrsto informacij ter način njihove uporabe. Pri določanju hrambe upoštevamo dejavnike, kot so naš namen obdelave informacij, količina, narava in občutljivost informacij, morebitno tveganje škode zaradi nepooblaščene uporabe ali razkritja ter morebitne pravne obveznosti, ki za nas veljajo.

Kako je razvoj ChatGPT-ja skladen z zakoni o zasebnosti?

Informacije za usposabljanje uporabljamo zakonito. Naši temeljni modeli poganjajo širok nabor koristnih aplikacij, vključno z orodji za dostopnost, podporo strankam, razvojem programske opreme, personaliziranim izobraževanjem in znanstvenim raziskovanjem. Te zmožnosti so odvisne od podatkov za učenje na velikem obsegu, vključno z javno dostopnimi informacijami in informacijami partnerjev tretjih oseb. V celotnem procesu usposabljanja uporabljamo zaščitne ukrepe, vključno s koraki, namenjenimi zmanjšanju obdelave osebnih podatkov v procesu usposabljanja in zmanjševanju tveganj, kot je opisano v tem članku. Zbiranje in uporabo osebnih podatkov, ki so vključeni v informacije za usposabljanje, utemeljujemo z zakonitimi interesi v skladu z zakoni o zasebnosti, kot je GDPR, med drugim za usposabljanje in izboljševanje naših modelov za uporabnike in širšo družbo, skladno z našim poslanstvom zagotoviti, da splošna umetna inteligenca koristi vsem, kot je podrobneje pojasnjeno v našem Pravilniku o zasebnosti. Izvedli smo oceno učinka v zvezi z varstvom podatkov, da bi lažje zagotovili, da te informacije zbiramo in uporabljamo zakonito ter odgovorno.

Kdaj se lahko informacije delijo ali prenesejo

Osebnih podatkov ne »prodajamo« in osebne podatke v podatkih za usposabljanje razkrivamo le v omejenih okoliščinah, opisanih v našem pravilniku o zasebnosti. Na primer, informacije lahko delimo s povezanimi družbami, ponudniki in izvajalci storitev, ki podpirajo razvoj, preizkušanje in izboljševanje naših modelov. Informacije lahko razkrijemo tudi, kadar v dobri veri menimo, da je takšno dejanje potrebno za izpolnitev pravne obveznosti ali za zaščito naših pravic, varnosti in zaščite ter pravic, varnosti in zaščite naših uporabnikov, zaposlenih ali javnosti, kot je opisano v našem Pravilniku o zasebnosti.

Ker je naša infrastruktura globalna, se lahko osebni podatki v podatkih za usposabljanje obdelujejo v državah zunaj EGP, Švice ali Združenega kraljestva (vključno z Združenimi državami). Kadar se to zgodi, uporabljamo ustrezne zaščitne ukrepe, kot so sklepi o ustreznosti ali standardne pogodbene klavzule, kot je opisano v našem Pravilniku o zasebnosti.

Vaše pravice in kako jih uveljavljati

Odzivamo se na zahteve za ugovor in podobne zahteve za uveljavljanje pravic. Kot posledica učenja jezika lahko odgovori ChatGPT-ja včasih vključujejo osebne podatke o posameznikih, katerih osebni podatki se večkrat pojavijo na javnem internetu (na primer o javnih osebnostih). Posamezniki v nekaterih jurisdikcijah lahko ugovarjajo obdelavi svojih osebnih podatkov s strani naših modelov ali vložijo druge zahteve za uveljavljanje pravic posameznika, na katerega se nanašajo osebni podatki, prek našega Portala zasebnosti. Te pravice lahko uveljavljate tudi tako, da nam pišete na privacy@openai.com

Da bomo lažje ocenili vašo zahtevo in nanjo odgovorili, navedite dovolj informacij, da bomo razumeli, na katere osebne podatke se zahteva nanaša, na primer vaše ime, ustrezne URL-je, konkretne primere izhodnih vsebin modela ali druge podrobnosti, ki pomagajo prepoznati težavo. V nekaterih primerih vas lahko prosimo, da preverite svojo identiteto ali potrdite, da se informacije nanašajo na vas, preden lahko ukrepamo. Več informacij o tem, kako vložiti te zahteve, vključno z najboljšimi praksami in načinom pregleda zahtev, je na voljo v našem članku Centra za pomoč o odstranitvi osebnih podatkov iz ChatGPT-ja. Zahteve pregledamo v skladu z veljavnimi zakoni o zasebnosti in nanje odgovorimo v veljavnih zakonskih rokih.

Upoštevajte, da v skladu z zakoni o zasebnosti nekatere pravice morda niso absolutne. Na primer, zahteve morda ne bomo mogli izpolniti, kadar ne moremo preveriti ustreznih informacij, kadar se zahteva ne nanaša na osebne podatke, ki jih obdeluje OpenAI, kadar velja izjema ali kadar imamo drug zakonit razlog za takšno ravnanje. Zahteve se ocenjujejo od primera do primera in lahko vključujejo tehtanje pravic do zasebnosti v primerjavi z drugimi pomembnimi vidiki, kot sta svoboda izražanja in javni interes. 

Kljub temu si prizadevamo dati prednost varstvu osebnih podatkov in spoštovati vse veljavne zakone o zasebnosti. Če menite, da težave nismo ustrezno obravnavali, imate pravico vložiti pritožbo pri svojem lokalnem nadzornem organu.

Za več informacij o praksah OpenAI v zvezi z osebnimi podatki, ki jih zbiramo od vas ali o vas, ko uporabljate naše spletno mesto, aplikacije in storitve, si oglejte naš Pravilnik o zasebnosti.

Ali vam je bil ta članek v pomoč?