OpenAI pamatiniai modeliai, įskaitant modelius, kuriais grindžiama ChatGPT veikla, kuriami naudojant tris pagrindinius informacijos šaltinius: 1) viešai internete prieinamą informaciją, 2) informaciją, prie kurios prieigą gauname bendradarbiaudami su trečiosiomis šalimis, ir 3) informaciją, kurią pateikia arba kuria mūsų naudotojai, instruktoriai ir tyrėjai.
Tokių pamatinių modelių, kokie naudojami ChatGPT, kūrimas apima kelis etapus: mokymo duomenų parengimą, išankstinį mokymą ir tolesnį mokymą, taip pat nuolatinį vertinimą ir tobulinimą po įdiegimo. Šiuose etapuose įvairiais tikslais gali būti naudojama skirtingų rūšių informacija, be kita ko, siekiant gerinti modelių veikimą, patikimumą ir saugą.
Šiame straipsnyje apžvelgiama, kokią informaciją naudojame šiems modeliams kurti, kaip ją renkame ir naudojame laikydamiesi privatumo įstatymų ir kokias apsaugos priemones taikome visame mokymo procese. Norėdami sužinoti, kaip renkame ir naudojame savo paslaugų naudotojų informaciją, įskaitant tai, kaip atsisakyti, kad ChatGPT pokalbiai būtų naudojami mūsų modeliams tobulinti, žr. mūsų privatumo politiką ir šį Pagalbos centro straipsnį.
Kas yra ChatGPT ir kaip ji veikia?
ChatGPT – tai dirbtiniu intelektu pagrįsta paslauga, kurią galite pasiekti internetu arba programėlėje. ChatGPT galite naudoti įvairioms užduotims: informacijai tvarkyti ir apibendrinti, versti, programuoti, atlikti tyrimus ir analizę, kelių etapų užduotis skirtingais įrankiais, analizuoti ar generuoti vaizdus, kūrybiškumui ir idėjoms skatinti bei kitai kasdienei veiklai. ChatGPT sukurta taip, kad suprastų naudotojų klausimus bei nurodymus ir į juos atsakytų, išmokusi dėsningumų iš didelio kiekio informacijos, įskaitant tekstą, vaizdus, garsą ir vaizdo įrašus.
Mokymo metu modelis analizuoja šių duomenų sąsajas, pavyzdžiui, kaip žodžiai paprastai vartojami kartu tam tikrame kontekste, ir remdamasis šiuo supratimu generuodamas atsakymą po vieną žodį numato kitą labiausiai tikėtiną žodį. Tekstas gali būti suskaidomas į mažesnius vienetus, kartais vadinamus „tokenais“, kurie gali atitikti ištisus žodžius, jų dalis arba skyrybos ženklus. Tokenai yra modelio apdorojamo teksto sudedamosios dalys. Panašiai modeliai, generuojantys kitų formų turinį, pavyzdžiui, vaizdus, iš mokymo duomenų išmoksta dėsningumų, siejančių pikselius tarpusavyje ir su atitinkamais aprašais.
Pavyzdžiui, modelio mokymosi proceso, vadinamo „mokymu“, metu modeliui gali būti pavesta užbaigti tokį sakinį: „Užuot pasukusi į kairę, ji pasuko ___.“ Ankstyvame mokymo etape jo atsakymai dažniausiai būna atsitiktiniai. Tačiau apdorodamas didelį kiekį teksto ir iš jo mokydamasis modelis vis geriau atpažįsta dėsningumus ir numato labiausiai tikėtiną kitą žodį. Šis procesas kartojamas su milijonais sakinių, kad modelio supratimas taptų išsamesnis, o tikslumas – didesnis.
Kadangi sakinį galima pagrįstai užbaigti keliais būdais, pavyzdžiui, „Užuot pasukusi į kairę, ji pasuko į dešinę“, „apsisuko“ arba „pasuko atgal“, modelio atsakymams būdingas tam tikras atsitiktinumas. Todėl tą patį klausimą pateikus kelis kartus galima gauti skirtingus atsakymus.
Mašininio mokymosi modelius sudaro dideli skaičių, vadinamų „svoriais“ arba „parametrais“, rinkiniai ir šiuos skaičius interpretuojantis bei naudojantis kodas. Šie modeliai nesaugo duomenų, iš kurių buvo mokomi, kopijų. Modeliui mokantis jo parametrų vertės šiek tiek koreguojamos, kad atspindėtų nustatytus dėsningumus. Ankstesniame pavyzdyje modelis nuo atsitiktinių žodžių numatymo perėjo prie tikslesnių prognozių ne todėl, kad išsaugojo mokymo sakinius, o todėl, kad atnaujino savo vidinius parametrus. Modelis neišsaugo mokymo metu apdorotų sakinių, vaizdų ar garso įrašų kopijų. ChatGPT „nekopijuoja ir neįklijuoja“ mokymo duomenų. Panašiai ir daug mokęsis mokytojas gali paaiškinti sąvokas, nes supranta idėjų sąsajas, nors nėra pažodžiui įsiminęs ir neatkartoja pirminės medžiagos. Generuodamas atsakymą į naudotojo užklausą modelis pagal šiuos išmoktus svorius numato ir kuria naują turinį.
Kokia informacija naudojama ChatGPT mokyti?
Iš viešai prieinamo interneto turinio naudojame tik laisvai ir atvirai internete pasiekiamą informaciją. Tai gali būti viešai prieinami tinklalapiai, vieši forumai, tinklaraščiai bei įrašai ir kitas viešai internete prieinamas turinys. Pavyzdžiui, jei dalyvaujate viešai prieinamame interneto diskusijų forume arba paskelbiate viešą tinklaraščio ar kitą įrašą, šį viešai prieinamą turinį galime naudoti modeliams mokyti. Vis dėlto imamės priemonių, kad mokymo procese būtų apdorojama mažiau asmens duomenų. Rinkdami viešai prieinamą interneto turinį, sąmoningai nerenkame duomenų iš šaltinių, kurie, kaip žinoma, prieinami tik už mokestį, arba iš tamsiojo interneto. Be to, filtrais pašaliname medžiagą, iš kurios nenorime mokyti savo modelių, pavyzdžiui, neapykantos kalbą, suaugusiesiems skirtą turinį, asmens duomenis kaupiančias svetaines ir brukalą. Likusi informacija naudojama mūsų modeliams mokyti.
Svetainių savininkai gali valdyti, ar jų svetainių viešai prieinamas turinys gali būti pasiekiamas ir naudojamas mokymui. Tam galima naudoti standartines žiniatinklio valdymo priemones, pavyzdžiui, faile robots.txt uždrausti GPTBot robotui tikrinti viešai prieinamą turinį, galintį padėti mokyti mūsų modelius. Svetainių savininkams pateikiame gaires, padedančias valdyti jų svetainių bei turinio sąveiką su mūsų DI sistemomis.
Savo modeliams mokyti ir tobulinti taip pat naudojame iš trečiųjų šalių partnerių gautą informaciją. Tai gali būti duomenų rinkinių informacija, prie kurios prieigą gauname pagal susitarimus su trečiosiomis šalimis, taip pat instruktorių ir tyrėjų pateikta ar sukurta informacija, kai tai leidžiama pagal mūsų taisykles ir susitarimus. Tai padeda gerinti mūsų modelių kokybę, saugą ir veikimą. Atsižvelgiant į duomenų rinkinį, šiuose šaltiniuose gali būti teksto, vaizdų, garso, vaizdo įrašų ar kitų rūšių duomenų.
Kai kuriuose mokymo procesuose taip pat vis dažniau naudojame sintetinius duomenis. Pavyzdžiui, naudodami informaciją ir savo modelius galime kurti sintetines užklausas, pavyzdžius įvairiomis kalbomis ar kitą mokymo medžiagą. Sintetiniai duomenys gali padėti gerinti modelio veikimą, pavyzdžiui, papildyti mokymo duomenis srityse, kuriose jų trūksta arba jie nėra subalansuoti, taip pat taikyti privatumą stiprinančius modelių kūrimo metodus.
Ar ChatGPT mokyti naudojami asmens duomenys?
Didelė internete skelbiamo turinio dalis yra susijusi su informacija apie žmones, todėl asmens duomenų gali atsitiktinai patekti ir į mūsų mokymo duomenis. Vis dėlto imamės priemonių, kad mokymo procese būtų apdorojama mažiau asmens duomenų.
Mokymo duomenis naudojame modelio gebėjimams, pavyzdžiui, numatymui, protavimui ir problemų sprendimui, ugdyti, o ne asmenų profiliams kurti, su jais susisiekti ar jiems pritaikytoms reklamoms rodyti.
Kai kuriais atvejais modeliai gali mokytis iš asmens duomenų, kad suprastų, kaip kalboje vartojami tokie elementai kaip vardai ir adresai, arba atpažintų viešus asmenis ir gerai žinomus subjektus. Tai padeda modeliui generuoti tikslesnius ir kontekstą geriau atitinkančius atsakymus.
Kaip asmens duomenys apsaugomi mokymo metu?
Aktyviai stengiamės riboti asmens duomenų apdorojimą mokymo metu. Pavyzdžiui, neįtraukiame žinomų šaltinių, kuriuose kaupiami dideli asmens duomenų kiekiai, filtruojame duomenis, kad mokymo procese būtų mažiau asmens duomenų, ir nustatome bei pašaliname pasikartojantį turinį, kad sumažintume mokymo duomenų atkartojimo riziką. Be to, mokome savo modelius neatsakyti į užklausas, kuriose prašoma privačios ar neskelbtinos informacijos apie asmenis.
Kiek laiko saugome informaciją
Mokymo duomenų informaciją saugome tik tiek, kiek pagrįstai būtina šiame straipsnyje ir mūsų privatumo politikoje nurodytiems tikslams, įskaitant mūsų modelių kūrimą bei tobulinimą ir susijusius mokslinius tyrimus. Informacijos saugojimo poreikis periodiškai peržiūrimas, o saugojimo trukmė priklauso nuo informacijos rūšies ir jos naudojimo būdo. Nustatydami saugojimo trukmę atsižvelgiame į informacijos apdorojimo tikslą, jos kiekį, pobūdį ir neskelbtinumą, galimą žalą dėl neteisėto jos naudojimo ar atskleidimo ir mums taikomus teisinius įsipareigojimus.
Kaip kuriant ChatGPT laikomasi privatumo įstatymų?
Mokymo informaciją naudojame teisėtai. Mūsų pamatiniai modeliai naudojami daugelyje naudingų programų, įskaitant prieinamumo priemones, klientų aptarnavimą, programinės įrangos kūrimą, individualizuotą švietimą ir mokslinius tyrimus. Šie gebėjimai priklauso nuo didelio masto mokymo duomenų, įskaitant viešai prieinamą informaciją ir iš trečiųjų šalių partnerių gautą informaciją. Visame mokymo procese taikome apsaugos priemones, įskaitant šiame straipsnyje aprašytus veiksmus, skirtus asmens duomenų apdorojimui mokymo metu mažinti ir rizikai švelninti. Mokymo informacijoje esančius asmens duomenis renkame ir naudojame remdamiesi privatumo įstatymuose, pavyzdžiui, BDAR, numatytais teisėtais interesais. Tai apima mūsų modelių mokymą ir tobulinimą naudotojų bei visos visuomenės labui, laikantis misijos užtikrinti, kad bendrasis dirbtinis intelektas būtų naudingas visiems. Daugiau informacijos pateikta mūsų privatumo politikoje. Atlikome poveikio duomenų apsaugai vertinimą, kad padėtume užtikrinti, jog šią informaciją renkame ir naudojame teisėtai bei atsakingai.
Kada informacija gali būti bendrinama arba perduodama
Asmens duomenų „neparduodame“, o mokymo duomenyse esančius asmens duomenis atskleidžiame tik mūsų privatumo politikoje aprašytomis ribotomis aplinkybėmis. Pavyzdžiui, galime dalytis informacija su susijusiomis įmonėmis, tiekėjais ir paslaugų teikėjais, padedančiais kurti, išbandyti ir tobulinti mūsų modelius. Informaciją taip pat galime atskleisti sąžiningai manydami, kad tai būtina teisinei prievolei įvykdyti arba mūsų, mūsų naudotojų, darbuotojų ar visuomenės teisėms, saugai ir saugumui apsaugoti, kaip aprašyta mūsų privatumo politikoje.
Kadangi mūsų infrastruktūra yra pasaulinė, mokymo duomenyse esantys asmens duomenys gali būti apdorojami EEE, Šveicarijai ar Jungtinei Karalystei nepriklausančiose šalyse, įskaitant Jungtines Amerikos Valstijas. Tokiais atvejais taikome tinkamas apsaugos priemones, pavyzdžiui, sprendimus dėl tinkamumo arba standartines sutarčių sąlygas, kaip aprašyta mūsų privatumo politikoje.
Jūsų teisės ir kaip jomis pasinaudoti
Atsakome į prašymus nesutikti su duomenų tvarkymu ir panašius prašymus pasinaudoti teisėmis. Kadangi ChatGPT mokosi kalbos, jos atsakymuose kartais gali būti asmens duomenų apie žmones, kurių duomenys daug kartų skelbiami viešajame internete, pavyzdžiui, apie viešus asmenis. Tam tikrose jurisdikcijose esantys asmenys gali nesutikti, kad mūsų modeliai apdorotų jų asmens duomenis, arba pateikti kitus prašymus pasinaudoti duomenų subjektų teisėmis per mūsų Privatumo portalą. Šiomis teisėmis taip pat galite pasinaudoti parašę adresu privacy@openai.com.
Kad galėtume įvertinti jūsų prašymą ir į jį atsakyti, pateikite pakankamai informacijos, kad suprastume, su kokiais asmens duomenimis jis susijęs, pavyzdžiui, savo vardą ir pavardę, atitinkamus URL adresus, konkrečius modelio išvesties pavyzdžius ar kitą informaciją, padedančią nustatyti problemą. Kai kuriais atvejais, prieš imdamiesi veiksmų, galime paprašyti patvirtinti savo tapatybę arba tai, kad informacija yra susijusi su jumis. Daugiau informacijos apie šių prašymų pateikimą, įskaitant rekomendacijas ir prašymų vertinimo tvarką, rasite mūsų Pagalbos centro straipsnyje apie asmens duomenų pašalinimą iš ChatGPT. Prašymus nagrinėjame laikydamiesi taikomų privatumo įstatymų ir atsakome per teisės aktuose nustatytus terminus.
Atminkite, kad pagal privatumo įstatymus kai kurios teisės nėra absoliučios. Pavyzdžiui, prašymo galime negalėti įvykdyti, jei negalime patikrinti atitinkamos informacijos, prašymas nesusijęs su OpenAI apdorojamais asmens duomenimis, taikoma išimtis arba turime kitą teisėtą pagrindą jo nevykdyti. Prašymai vertinami individualiai ir gali reikėti derinti teisę į privatumą su kitais svarbiais aspektais, pavyzdžiui, saviraiškos laisve ir viešuoju interesu.
Vis dėlto stengiamės teikti pirmenybę asmens duomenų apsaugai ir laikytis visų taikomų privatumo įstatymų. Jei manote, kad tinkamai neišsprendėme problemos, turite teisę pateikti skundą savo vietos priežiūros institucijai.
Daugiau informacijos apie OpenAI praktiką, susijusią su asmens duomenimis, kuriuos renkame iš jūsų ar apie jus, kai naudojatės mūsų svetaine, programomis ir paslaugomis, rasite mūsų privatumo politikoje.
