OpenAI
See leht on masintõlgitud. Vaadake algset ingliskeelset artiklit.

Kuidas ChatGPT-d ja meie alusmudeleid arendatakse

Lisateave selle kohta, kuidas me oma mudeleid arendame ja kasutame neid sellistes toodetes nagu ChatGPT

Värskendatud: 15 days ago

OpenAI alusmudeleid, sealhulgas ChatGPT aluseks olevaid mudeleid, arendatakse kolme peamise teabeallika abil: (1) internetis avalikult kättesaadav teave, (2) teave, millele saame juurdepääsu koostöös kolmandate osapooltega, ja (3) teave, mida meie kasutajad, inimkoolitajad ja teadlased esitavad või loovad.

Selliste alusmudelite arendamine, mida kasutatakse ChatGPT-s, hõlmab mitut etappi, sealhulgas koolitusandmete ettevalmistamist, eelkoolitust ja järelkoolitust ning pärast kasutuselevõttu pidevat hindamist ja täiustamist. Nendes etappides võidakse eri eesmärkidel kasutada erinevat liiki teavet, muu hulgas mudeli jõudluse, töökindluse ja ohutuse parandamiseks. 

Selles artiklis antakse ülevaade teabest, mida kasutame nende mudelite arendamiseks, sellest, kuidas me seda teavet kooskõlas privaatsusõigusega kogume ja kasutame, ning kaitsemeetmetest, mida rakendame kogu koolitusprotsessi vältel. Et mõista, kuidas me oma teenuste kasutajatelt teavet kogume ja kasutame, sealhulgas kuidas keelata ChatGPT vestluste kasutamine meie mudelite täiustamiseks, tutvuge meie privaatsuspõhimõtetega ja selle Abikeskuse artikliga.

Mis on ChatGPT ja kuidas see töötab?

ChatGPT on tehisintellektil põhinev teenus, mida saab kasutada internetis või rakenduse kaudu. ChatGPT-d saab kasutada väga mitmesugusteks ülesanneteks, näiteks teabe korrastamiseks ja kokkuvõtmiseks, tõlkimiseks, programmeerimise, uurimistöö ja analüüsi abivahendina, mitmeetapiliste ülesannete täitmiseks eri tööriistades, piltide analüüsimiseks või loomiseks, loovuse ja ideede ergutamiseks ning muudeks igapäevatoiminguteks. ChatGPT on loodud kasutajate küsimuste ja juhiste mõistmiseks ning neile vastamiseks, õppides mustreid suurest hulgast teabest, sealhulgas tekstist, piltidest, helist ja videost. 

Koolituse ajal analüüsib mudel andmetes esinevaid seoseid, näiteks seda, kuidas sõnad tavaliselt kontekstis koos esinevad, ning kasutab saadud arusaama vastuse loomisel järgmise kõige tõenäolisema sõna ennustamiseks, üks sõna korraga. Teksti võib teisendada väiksemateks üksusteks, mida mõnikord nimetatakse „tokeniteks“ ja mis võivad tähistada terveid sõnu, sõnaosi või kirjavahemärke. Tokenid on teksti ehituskivid, mida mudel töötleb. Samamoodi õpivad muud liiki sisu, näiteks pilte loovad mudelid koolitusandmetest mustreid selle kohta, kuidas pikslid on omavahel ja seotud pildiallkirjadega seotud.

Näiteks võidakse mudelile õppimise ehk „koolituse“ ajal anda ülesanne lõpetada lause „Selle asemel et pöörata vasakule, pööras ta ___.“ Koolituse alguses on mudeli vastused suuresti juhuslikud. Kui aga mudel töötleb suurt hulka teksti ja õpib sellest, hakkab ta mustreid paremini ära tundma ning järgmist kõige tõenäolisemat sõna täpsemalt ennustama. Seda protsessi korratakse miljonite lausetega, et mudeli arusaama täpsustada ja ennustustäpsust parandada.

Kuna lauset saab usutavalt lõpetada mitmel viisil, näiteks „Selle asemel et pöörata vasakule, pööras ta paremale“, „ümber“ või „tagasi“, sisaldavad mudeli vastused olemuslikult teatavat juhuslikkust. Seetõttu võib sama küsimus anda eri päringute korral erinevaid vastuseid.

Masinõppemudelid koosnevad suurtest arvukogumitest, mida nimetatakse „kaaludeks“ või „parameetriteks“, ning koodist, mis neid arve tõlgendab ja kasutab. Need mudelid ei talleta ega säilita koopiaid andmetest, mille põhjal neid koolitatakse. Selle asemel korrigeeritakse mudeli õppimise käigus veidi selle parameetrite väärtusi, et kajastada mudeli tuvastatud mustreid. Eelmises näites muutusid mudeli ennustused juhuslikest sõnadest täpsemaks mitte koolituslauseid talletades, vaid sisemisi parameetreid ajakohastades. Mudel ei säilita koopiaid lausetest, piltidest ega helist, mida see koolituse ajal töötleb. ChatGPT ei „kopeeri ega kleebi“ oma koolitusandmetest. Seda võib võrrelda õpetajaga, kes suudab pärast põhjalikku õppimist selgitada mõisteid ideedevaheliste seoste mõistmise kaudu, ilma algmaterjale pähe õppimata või sõna-sõnalt kordamata. Kasutaja päringule vastust luues kasutab mudel neid õpitud kaale uue sisu ennustamiseks ja loomiseks.

Millist teavet kasutatakse ChatGPT õpetamiseks?

Internetis avalikult kättesaadavast sisust kasutame ainult teavet, millele pääseb internetis vabalt ja avatult juurde. See võib hõlmata avalikult kättesaadavaid veebilehti, avalikke foorumeid ja blogisid, avalikke postitusi ning muud internetis avalikult kättesaadavat sisu. Näiteks kui osalete avalikult kättesaadavas veebifoorumis või avaldate avaliku blogi- või muu postituse, võime seda avalikult kättesaadavat sisu kasutada mudelite koolitamiseks. Võtame siiski meetmeid, et vähendada koolitusprotsessis isikuandmete töötlemist.  Internetis avalikult kättesaadavat sisu kogudes ei hangi me tahtlikult andmeid allikatest, mis on teadaolevalt maksumüüri taga, ega tumeveebist. Lisaks kasutame filtreid, et eemaldada materjal, millest me ei soovi oma mudeleid õpetada, näiteks vaenukõne, täiskasvanutele mõeldud sisu, isikuandmeid koondavad saidid ja rämpspost. Ülejäänud teavet kasutatakse seejärel meie mudelite koolitamiseks. 

Veebisaitide omanikud saavad tavapäraste veebijuhiste, näiteks faili robots.txt abil hallata, kas nende saitide avalikult kättesaadavale sisule võib koolitamiseks juurde pääseda. Selleks saab keelata GPTBoti, mis võib meie mudelite koolitamiseks avalikult kättesaadavat sisu indekseerida. Pakume veebisaitide omanikele juhiseid, mis aitavad hallata nende saitide ja sisu suhtlust meie tehisintellektisüsteemidega. 

Kasutame oma mudelite koolitamiseks ja täiustamiseks ka kolmandatest osapooltest partneritelt saadud teavet. See võib hõlmata teavet andmekogudes, millele pääseme ligi kolmandate osapooltega sõlmitud lepingute alusel, ning inimkoolitajate ja teadlaste esitatud või loodud teavet, kui meie põhimõtted ja lepingud seda lubavad. See aitab parandada meie mudelite kvaliteeti, ohutust ja jõudlust. Olenevalt andmekogust võivad need allikad sisaldada teksti, pilte, heli, videot või muud liiki andmeid.

Samuti kasutame mõnes koolitusprotsessis üha rohkem sünteetilisi andmeid. Näiteks võime kasutada teavet ja oma mudeleid sünteetiliste viipade, mitmekeelsete näidete või muude koolitusmaterjalide loomiseks. Sünteetilised andmed võivad parandada mudeli jõudlust, muu hulgas täiendades koolitusandmeid valdkondades, kus neid napib või nende jaotus on ebaühtlane. Samuti võivad need toetada mudelite privaatsust suurendavaid arendusviise.

Kas ChatGPT õpetamiseks kasutatakse isikuandmeid?

Märkimisväärne osa veebisisust sisaldab teavet inimeste kohta, mistõttu võivad meie koolitusandmed juhuslikult sisaldada ka isikuandmeid. Võtame siiski meetmeid, et vähendada koolitusprotsessis isikuandmete töötlemist.

Kasutame koolitusandmeid mudeli võimete, näiteks ennustamise, arutluse ja probleemilahenduse arendamiseks, mitte üksikisikute profiilide koostamiseks, nendega ühenduse võtmiseks ega neile reklaamide isikupärastamiseks.

Mõnel juhul võivad mudelid õppida isikuandmetest, et mõista, kuidas nimed ja aadressid keeles toimivad, või et tunda ära avaliku elu tegelasi ja üldtuntud üksusi. See aitab mudelil luua täpsemaid ja konteksti paremini sobivaid vastuseid.

Kuidas kaitstakse isikuandmeid koolituse ajal?

Võtame aktiivselt meetmeid, et piirata koolituse ajal isikuandmete töötlemist. Näiteks jätame välja teadaolevad allikad, mis koondavad suures koguses isikuandmeid, kasutame filtreid isikuandmete hulga vähendamiseks koolitusprotsessis ning tuvastame ja eemaldame dubleeriva sisu, et vähendada koolitusandmete kordamise ohtu. Lisaks õpetame oma mudeleid vältima vastamist päringutele, milles küsitakse üksikisikute privaatset või tundlikku teavet. 

Kui kaua me teavet säilitame?

Säilitame koolitusandmetes sisalduvat teavet ainult nii kaua, kui see on mõistlikult vajalik selles artiklis ja meie privaatsuspõhimõtetes kirjeldatud eesmärkidel, sealhulgas mudelite arendamiseks ja täiustamiseks ning nendega seotud teadusuuringuteks. Säilitamise jätkuvat vajalikkust vaadatakse korrapäraselt üle ning säilitamisaeg oleneb teabe liigist ja kasutusviisist. Säilitamisaja määramisel võtame arvesse muu hulgas teabe töötlemise eesmärki, teabe hulka, laadi ja tundlikkust, loata kasutamisest või avaldamisest tuleneva kahju võimalikku ohtu ning meile kehtivaid õiguslikke kohustusi.

Kuidas järgitakse ChatGPT arendamisel privaatsusõigust?

Kasutame koolitusteavet seaduslikult. Meie alusmudelid võimaldavad kasutada paljusid kasulikke rakendusi, sealhulgas hõlbustusvahendeid, kliendituge, tarkvaraarendust, isikupärastatud õpet ja teadusuuringuid. Need võimed sõltuvad suuremahulise koolituse andmetest, sealhulgas avalikult kättesaadavast teabest ja kolmandatest osapooltest partneritelt saadud teabest. Rakendame kogu koolitusprotsessi vältel kaitsemeetmeid, sealhulgas selles artiklis kirjeldatud samme, mille eesmärk on vähendada koolitusprotsessis isikuandmete töötlemist ja maandada riske. Tugineme koolitusteabes sisalduvate isikuandmete kogumisel ja kasutamisel privaatsusõiguse, näiteks isikuandmete kaitse üldmääruse kohasele õigustatud huvile. See hõlmab meie mudelite koolitamist ja täiustamist kasutajate ning ühiskonna hüvanguks kooskõlas meie eesmärgiga tagada, et üldine tehisintellekt tooks kasu kõigile, nagu on täpsemalt selgitatud meie privaatsuspõhimõtetes. Oleme koostanud andmekaitsealase mõjuhinnangu, mis aitab tagada, et kogume ja kasutame seda teavet seaduslikult ning vastutustundlikult.

Millal võidakse teavet jagada või edastada?

Me ei „müü“ isikuandmeid ja avaldame koolitusandmetes sisalduvaid isikuandmeid ainult meie privaatsuspõhimõtetes kirjeldatud piiratud juhtudel. Näiteks võime jagada teavet sidusettevõtjate, tarnijate ja teenuseosutajatega, kes toetavad meie mudelite arendamist, testimist ja täiustamist. Võime teavet avaldada ka siis, kui usume heas usus, et see on vajalik õigusliku kohustuse täitmiseks või meie ning meie kasutajate, töötajate või avalikkuse õiguste ja turvalisuse kaitsmiseks, nagu on kirjeldatud meie privaatsuspõhimõtetes.

Kuna meie taristu on üleilmne, võidakse koolitusandmetes sisalduvaid isikuandmeid töödelda väljaspool EMP-d, Šveitsi või Ühendkuningriiki asuvates riikides, sealhulgas Ameerika Ühendriikides. Sellisel juhul rakendame asjakohaseid kaitsemeetmeid, näiteks kaitse piisavuse otsuseid või lepingu tüüptingimusi, nagu on kirjeldatud meie privaatsuspõhimõtetes.

Teie õigused ja nende kasutamine

Vastame vastuväidetele ja muudele sarnastele andmesubjekti õiguste kasutamise taotlustele. Keele õppimise tulemusena võivad ChatGPT vastused mõnikord sisaldada isikuandmeid inimeste kohta, kelle isikuandmed esinevad avalikus internetis korduvalt, näiteks avaliku elu tegelaste kohta. Teatud jurisdiktsioonides saavad üksikisikud esitada vastuväite nende isikuandmete töötlemisele meie mudelite poolt või esitada muid andmesubjekti õiguste kasutamise taotlusi meie Privaatsusportaali kaudu. Neid õigusi saab kasutada ka aadressil privacy@openai.com ühendust võttes.

Et saaksime teie taotlust hinnata ja sellele vastata, esitage piisavalt teavet mõistmaks, milliseid isikuandmeid taotlus puudutab. Lisage näiteks oma nimi, asjakohased URL-id, konkreetsed näited mudeli väljunditest või muud andmed, mis aitavad probleemi tuvastada. Mõnel juhul võime enne meetmete võtmist paluda teil oma isikut tõendada või kinnitada, et teave puudutab teid. Lisateavet nende taotluste esitamise, sealhulgas heade tavade ja taotluste läbivaatamise kohta leiate meie Abikeskuse artiklist, mis käsitleb isikuandmete eemaldamist ChatGPT-st. Vaatame taotlused läbi kooskõlas kohaldatava privaatsusõigusega ja vastame seaduses ettenähtud tähtaja jooksul.

Arvestage, et privaatsusõiguse kohaselt ei pruugi mõned õigused olla absoluutsed. Näiteks ei pruugi me saada taotlust täita, kui me ei saa asjaomast teavet kontrollida, taotlus ei puuduta OpenAI töödeldavaid isikuandmeid, kohaldub erand või meil on selleks muu seaduslik põhjus. Taotlusi hinnatakse juhtumipõhiselt ning see võib hõlmata privaatsusõiguste tasakaalustamist muude oluliste kaalutlustega, nagu väljendusvabadus ja avalik huvi.

Püüame siiski seada isikuandmete kaitse esikohale ja järgida kõiki kohaldatavaid privaatsusõiguse nõudeid. Kui leiate, et me ei ole probleemi piisavalt lahendanud, on teil õigus esitada kaebus kohalikule järelevalveasutusele.

Lisateavet OpenAI tavade kohta seoses isikuandmetega, mida kogume teilt või teie kohta meie veebisaidi, rakenduste ja teenuste kasutamisel, leiate meie privaatsuspõhimõtetest.

Kas sellest artiklist oli abi?