OpenAI
Tämä sivu on konekäännetty. Katso alkuperäinen englanninkielinen artikkeli.

Miten ChatGPT ja perusmallimme kehitetään

Lue lisää siitä, miten kehitämme mallejamme ja käytämme niitä ChatGPT:n kaltaisissa tuotteissa

Päivitetty: 3 hours ago

OpenAI kehittää perusmallejaan, myös ChatGPT:n taustalla olevia malleja, käyttäen kolmea pääasiallista tietolähdettä: 1) internetissä julkisesti saatavilla olevaa tietoa, 2) tietoa, johon saamme pääsyn yhteistyössä kolmansien osapuolten kanssa, sekä 3) käyttäjiemme, ihmiskouluttajien ja tutkijoiden toimittamaa tai tuottamaa tietoa.

ChatGPT:n käyttämien kaltaisten perusmallien kehittämiseen kuuluu useita vaiheita, kuten koulutusaineiston valmistelu, valmistava koulutus ja jälkikoulutus sekä käyttöönoton jälkeinen jatkuva arviointi ja parantaminen. Näissä vaiheissa voidaan käyttää erityyppisiä tietoja eri tarkoituksiin, kuten mallien suorituskyvyn, luotettavuuden ja turvallisuuden parantamiseen. 

Tässä artikkelissa kerrotaan yleisesti, mitä tietoja käytämme näiden mallien kehittämiseen, kuinka keräämme ja käytämme tietoja tietosuojalainsäädännön mukaisesti sekä millaisia suojatoimia sovellamme koko koulutusprosessin ajan. Lisätietoja siitä, miten keräämme ja käytämme palvelujemme käyttäjien tietoja ja miten voit estää ChatGPT-keskustelujesi käyttämisen malliemme parantamiseen, on tietosuojakäytännössämme ja tässä ohjekeskuksen artikkelissa.

Mikä ChatGPT on ja miten se toimii?

ChatGPT on tekoälyyn perustuva palvelu, jota voi käyttää internetissä tai sovelluksella. ChatGPT:tä voi käyttää monenlaisiin tehtäviin, kuten tietojen järjestämiseen ja tiivistämiseen, kääntämisen, ohjelmoinnin, tutkimuksen ja analyysin tukena, monivaiheisten tehtävien suorittamiseen eri työkaluilla, kuvien analysointiin tai tuottamiseen, luovuuden ja ideoinnin apuna sekä muissa arjen toimissa. ChatGPT on suunniteltu ymmärtämään käyttäjien kysymyksiä ja ohjeita sekä vastaamaan niihin oppimalla säännönmukaisuuksia suurista tietomääristä, joihin kuuluu tekstiä, kuvia, ääntä ja videoita. 

Koulutuksen aikana malli analysoi aineiston sisäisiä yhteyksiä, kuten sitä, miten sanat tavallisesti esiintyvät yhdessä eri asiayhteyksissä. Tämän ymmärryksen avulla se ennustaa vastausta tuottaessaan sanan kerrallaan, mikä sana on todennäköisin seuraavaksi. Teksti voidaan jakaa pienempiin yksiköihin, joita kutsutaan joskus ”tokeneiksi”. Ne voivat vastata kokonaisia sanoja, sanojen osia tai välimerkkejä. Tokenit ovat tekstin rakennusosia, joita malli käsittelee. Vastaavasti muunlaista sisältöä, kuten kuvia, tuottavat mallit oppivat koulutusaineistosta säännönmukaisuuksia siinä, miten kuvapisteet liittyvät toisiinsa ja kuviin liitettyihin kuvateksteihin.

Mallin oppimisprosessin eli ”koulutuksen” aikana mallia voidaan esimerkiksi pyytää täydentämään seuraava virke: ”Sen sijaan, että hän olisi kääntynyt vasemmalle, hän kääntyi ___.” Koulutuksen alussa sen vastaukset ovat pitkälti satunnaisia. Kun malli käsittelee suuria tekstimääriä ja oppii niistä, se oppii kuitenkin tunnistamaan säännönmukaisuuksia ja ennustamaan todennäköisimmän seuraavan sanan yhä paremmin. Prosessi toistetaan miljoonilla virkkeillä, jotta mallin ymmärrys tarkentuu ja sen täsmällisyys paranee.

Koska virkkeen voi täydentää uskottavasti monella tavalla – esimerkiksi ”Sen sijaan, että hän olisi kääntynyt vasemmalle, hän kääntyi oikealle”, ”ympäri” tai ”takaisin” – mallin vastauksiin liittyy väistämättä jonkin verran satunnaisuutta. Siksi sama kysymys voi tuottaa eri kyselykerroilla erilaisia vastauksia.

Koneoppimismallit koostuvat suurista lukujoukoista, joita kutsutaan ”painoiksi” tai ”parametreiksi”, sekä näitä lukuja tulkitsevasta ja käyttävästä koodista. Mallit eivät tallenna tai säilytä jäljennöksiä aineistosta, jolla ne koulutetaan. Kun malli oppii, sen parametrien arvoja sen sijaan säädetään hieman kuvastamaan mallin tunnistamia säännönmukaisuuksia. Edellisessä esimerkissä malli kehittyi satunnaisten sanojen ennustamisesta täsmällisempiin ennusteisiin. Tämä ei tapahtunut tallentamalla koulutuksessa käytettyjä virkkeitä vaan päivittämällä mallin sisäisiä parametreja. Malli ei säilytä jäljennöksiä koulutuksen aikana käsittelemistään virkkeistä, kuvista tai äänistä. ChatGPT ei ”kopioi ja liitä” koulutusaineistoaan. Vastaavasti paljon opiskellut opettaja voi selittää käsitteitä ymmärtämällä ajatusten välisiä yhteyksiä ilman, että hän opettelee alkuperäisen aineiston ulkoa tai toistaa sitä sanatarkasti. Kun malli tuottaa vastauksen käyttäjän pyyntöön, se ennustaa ja luo uutta sisältöä oppimiensa painojen avulla.

Millaisia tietoja ChatGPT:n opettamiseen käytetään?

Käytämme internetin julkisesta sisällöstä vain tietoja, jotka ovat internetissä vapaasti ja avoimesti saatavilla. Tällaisia tietoja voivat olla julkiset verkkosivut, keskustelufoorumit, blogit ja julkaisut sekä muu julkisesti saatavilla oleva verkkosisältö. Jos esimerkiksi osallistut julkiseen verkkokeskusteluun tai julkaiset julkisen blogikirjoituksen tai muun julkaisun, saatamme käyttää tätä julkista sisältöä mallien kouluttamiseen. Pyrimme kuitenkin vähentämään henkilötietojen käsittelyä koulutusprosessissamme.  Kun keräämme internetissä julkisesti saatavilla olevaa sisältöä, emme tarkoituksellisesti kerää tietoja lähteistä, joiden tiedämme olevan maksumuurin takana, emmekä pimeästä verkosta. Lisäksi suodatamme pois aineistoa, josta emme halua malliemme oppivan, kuten vihapuhetta, aikuisille tarkoitettua sisältöä, henkilötietoja kokoavia sivustoja ja roskapostia. Jäljelle jääviä tietoja käytetään malliemme kouluttamiseen. 

Verkkosivustojen omistajat voivat hallita sivustojensa julkisen sisällön käyttämistä koulutuksessa estämällä GPTBotin tavallisilla verkkohallintakeinoilla, kuten robots.txt-tiedostolla. GPTBot saattaa indeksoida julkista sisältöä malliemme kouluttamista varten. Tarjoamme verkkosivustojen omistajille ohjeita siihen, miten he voivat hallita sivustojensa ja niiden sisällön vuorovaikutusta tekoälyjärjestelmiemme kanssa. 

Käytämme malliemme kouluttamiseen ja parantamiseen myös kolmansina osapuolina toimivilta kumppaneilta saatuja tietoja. Näihin voivat kuulua kolmansien osapuolten kanssa tehtyjen sopimusten nojalla käytettävissämme olevien aineistojen tiedot sekä ihmiskouluttajien ja tutkijoiden toimittamat tai tuottamat tiedot silloin, kun käytäntömme ja sopimuksemme sen sallivat. Näin voimme parantaa malliemme laatua, turvallisuutta ja suorituskykyä. Aineistosta riippuen näissä lähteissä voi olla tekstiä, kuvia, ääntä, videoita tai muuntyyppisiä tietoja.

Käytämme joissakin koulutusprosesseissa myös yhä enemmän synteettistä dataa. Voimme esimerkiksi tuottaa tietojen ja malliemme avulla synteettisiä kehotteita, monikielisiä esimerkkejä tai muuta koulutusaineistoa. Synteettinen data voi parantaa mallien suorituskykyä esimerkiksi täydentämällä koulutusaineistoa aloilla, joilla tietoa on vähän tai se on epätasapainoista. Se voi myös tukea yksityisyyttä vahvistavia mallinkehitysmenetelmiä.

Käytetäänkö ChatGPT:n opettamiseen henkilötietoja?

Merkittävä osa verkkosisällöstä sisältää tietoja ihmisistä, joten koulutusaineistoomme voi tahattomasti sisältyä henkilötietoja. Pyrimme kuitenkin vähentämään henkilötietojen käsittelyä koulutusprosessissamme.

Käytämme koulutusaineistoa mallin ominaisuuksien, kuten ennustamisen, päättelyn ja ongelmanratkaisun, kehittämiseen. Emme käytä sitä henkilöprofiilien laatimiseen, yhteydenottoihin tai mainosten personointiin.

Joissakin tapauksissa mallit voivat oppia henkilötiedoista ymmärtääkseen, miten esimerkiksi nimiä ja osoitteita käytetään kielessä, tai tunnistaakseen julkisuuden henkilöitä ja tunnettuja tahoja. Näin malli voi tuottaa täsmällisempiä ja asiayhteyteen paremmin sopivia vastauksia.

Miten henkilötietoja suojataan koulutuksen aikana?

Rajoitamme aktiivisesti henkilötietojen käsittelyä koulutuksen aikana. Jätämme esimerkiksi pois tunnetut lähteet, jotka kokoavat suuria määriä henkilötietoja, vähennämme henkilötietojen käsittelyä suodattamalla koulutusaineistoa sekä pyrimme tunnistamaan ja poistamaan päällekkäisen sisällön, jotta koulutusaineiston toistamisen riski pienenee. Lisäksi koulutamme mallejamme välttämään vastaamista pyyntöihin, jotka koskevat henkilöiden yksityisiä tai arkaluonteisia tietoja. 

Kuinka kauan säilytämme tietoja

Säilytämme koulutusaineiston tietoja vain niin kauan kuin on kohtuudella tarpeen tässä artikkelissa ja tietosuojakäytännössämme kuvattuihin tarkoituksiin, kuten malliemme kehittämiseen ja parantamiseen sekä niihin liittyvään tieteelliseen tutkimukseen. Tietojen säilyttämisen tarpeellisuus arvioidaan säännöllisesti, ja säilytysaika vaihtelee tietojen tyypin ja käyttötavan mukaan. Säilytysaikaa määrittäessämme otamme huomioon muun muassa tietojen käsittelyn tarkoituksen, tietojen määrän, luonteen ja arkaluonteisuuden, luvattoman käytön tai luovuttamisen mahdollisesti aiheuttaman vahingon riskin sekä meitä koskevat lakisääteiset velvoitteet.

Miten ChatGPT:n kehityksessä noudatetaan tietosuojalainsäädäntöä?

Käytämme koulutustietoja lainmukaisesti. Perusmallimme mahdollistavat monenlaisia hyödyllisiä sovelluksia, kuten saavutettavuustyökaluja, asiakastukea, ohjelmistokehitystä, yksilöllistä opetusta ja tieteellistä tutkimusta. Nämä ominaisuudet edellyttävät laajamittaista koulutusaineistoa, johon kuuluu julkisesti saatavilla olevia tietoja ja kolmansina osapuolina toimivilta kumppaneilta saatuja tietoja. Sovellamme koko koulutusprosessin ajan suojatoimia, joihin kuuluu tässä artikkelissa kuvattuja toimia henkilötietojen käsittelyn vähentämiseksi ja riskien lieventämiseksi. Perustamme koulutustietoihin sisältyvien henkilötietojen keräämisen ja käytön GDPR:n ja muun tietosuojalainsäädännön mukaisiin oikeutettuihin etuihin. Näihin kuuluu malliemme kouluttaminen ja parantaminen käyttäjien ja koko yhteiskunnan hyväksi sekä sen tehtävämme mukaisesti, että yleinen tekoäly hyödyttää kaikkia. Asiaa selostetaan tarkemmin tietosuojakäytännössämme. Olemme tehneet tietosuojaa koskevan vaikutustenarvioinnin varmistaaksemme osaltamme, että keräämme ja käytämme näitä tietoja lainmukaisesti ja vastuullisesti.

Milloin tietoja voidaan jakaa tai siirtää

Emme ”myy” henkilötietoja. Luovutamme koulutusaineistoon sisältyviä henkilötietoja vain tietosuojakäytännössämme kuvatuissa rajatuissa tilanteissa. Voimme esimerkiksi jakaa tietoja konserniyhtiöille, toimittajille ja palveluntarjoajille, jotka tukevat malliemme kehittämistä, testaamista ja parantamista. Voimme myös luovuttaa tietoja, jos uskomme vilpittömästi sen olevan tarpeen lakisääteisen velvoitteen noudattamiseksi tai meidän, käyttäjiemme, työntekijöidemme tai yleisön oikeuksien, turvallisuuden ja suojan takaamiseksi, kuten tietosuojakäytännössämme kuvataan.

Koska infrastruktuurimme on maailmanlaajuinen, koulutusaineiston henkilötietoja voidaan käsitellä ETA-alueen, Sveitsin tai Yhdistyneen kuningaskunnan ulkopuolisissa maissa, myös Yhdysvalloissa. Näissä tapauksissa käytämme asianmukaisia suojatoimia, kuten tietosuojan riittävyyttä koskevia päätöksiä tai vakiosopimuslausekkeita, kuten tietosuojakäytännössämme kuvataan.

Oikeutesi ja niiden käyttäminen

Vastaamme vastustamispyyntöihin ja muihin vastaaviin oikeuksien käyttämistä koskeviin pyyntöihin. Koska ChatGPT on oppinut kieltä, sen vastauksissa voi joskus esiintyä henkilötietoja ihmisistä, joiden henkilötietoja esiintyy julkisessa internetissä useita kertoja, kuten julkisuuden henkilöistä. Tietyillä lainkäyttöalueilla henkilöt voivat vastustaa henkilötietojensa käsittelyä malleissamme tai esittää muita rekisteröidyn oikeuksia koskevia pyyntöjä Tietosuojaportaalissamme. Voit käyttää näitä oikeuksia myös ottamalla yhteyttä osoitteeseen privacy@openai.com.

Jotta voimme arvioida pyyntösi ja vastata siihen, anna riittävästi tietoja, jotta ymmärrämme, mitä henkilötietoja pyyntösi koskee. Voit ilmoittaa esimerkiksi nimesi, asiaankuuluvat URL-osoitteet, yksittäisiä esimerkkejä mallin tuottamista vastauksista tai muita tietoja, jotka auttavat ongelman tunnistamisessa. Joissakin tapauksissa saatamme pyytää sinua todistamaan henkilöllisyytesi tai vahvistamaan tietojen koskevan sinua, ennen kuin voimme ryhtyä toimiin. Lisätietoja näiden pyyntöjen tekemisestä, suositelluista käytännöistä ja pyyntöjen arvioinnista on ChatGPT:ssä olevien henkilötietojen poistamista käsittelevässä ohjekeskuksen artikkelissamme. Arvioimme pyynnöt sovellettavan tietosuojalainsäädännön mukaisesti ja vastaamme niihin laissa säädetyssä ajassa.

Huomaa, etteivät kaikki oikeudet välttämättä ole tietosuojalainsäädännön mukaan ehdottomia. Emme esimerkiksi välttämättä voi täyttää pyyntöä, jos emme voi vahvistaa asiaankuuluvia tietoja, pyyntö ei koske OpenAI:n käsittelemiä henkilötietoja, tilanteeseen sovelletaan poikkeusta tai meillä on jokin muu lainmukainen peruste olla täyttämättä pyyntöä. Pyynnöt arvioidaan tapauskohtaisesti. Arvioinnissa voidaan joutua punnitsemaan yksityisyyteen liittyviä oikeuksia suhteessa muihin tärkeisiin näkökohtiin, kuten sananvapauteen ja yleiseen etuun.

Pyrimme kuitenkin asettamaan henkilötietojen suojaamisen etusijalle ja noudattamaan kaikkea sovellettavaa tietosuojalainsäädäntöä. Jos katsot, ettemme ole käsitelleet asiaa asianmukaisesti, sinulla on oikeus tehdä valitus paikalliselle valvontaviranomaiselle.

Lisätietoja OpenAI:n käytännöistä, jotka koskevat sinulta tai sinusta keräämiämme henkilötietoja käyttäessäsi verkkosivustoamme, sovelluksiamme ja palvelujamme, on tietosuojakäytännössämme.

Oliko tästä artikkelista apua?