OpenAI
Þessi síða var vélþýdd. Skoða upprunalegu ensku greinina.

Hvernig ChatGPT og grunnlíkön okkar eru þróuð

Kynntu þér hvernig við þróum líkön okkar og notum þau í vörum eins og ChatGPT

Uppfært: 2 days ago

Grunnlíkön OpenAI, þar á meðal líkönin sem knýja ChatGPT, eru þróuð með upplýsingum úr þremur meginuppsprettum: (1) upplýsingum sem eru aðgengilegar almenningi á internetinu, (2) upplýsingum sem við fáum aðgang að í samstarfi við þriðju aðila og (3) upplýsingum sem notendur okkar, mannlegir þjálfarar og rannsakendur veita eða búa til.

Þróun grunnlíkana á borð við þau sem ChatGPT notar fer fram í nokkrum áföngum, þar á meðal undirbúningi þjálfunargagna, forþjálfun og eftirþjálfun, auk stöðugs mats og umbóta eftir innleiðingu. Mismunandi tegundir upplýsinga kunna að vera notaðar á þessum stigum í ýmsum tilgangi, meðal annars til að bæta afköst, áreiðanleika og öryggi líkana. 

Í þessari grein er yfirlit yfir upplýsingarnar sem við notum við þróun þessara líkana, hvernig við söfnum og notum upplýsingarnar í samræmi við persónuverndarlög og þær öryggisráðstafanir sem við beitum í öllu þjálfunarferlinu. Til að kynna þér hvernig við söfnum og notum upplýsingar frá notendum þjónustu okkar, þar á meðal hvernig hægt er að hafna því að samtöl í ChatGPT séu notuð til að bæta líkönin okkar, skaltu lesa persónuverndarstefnu okkar og þessa grein í Hjálparmiðstöðinni.

Hvað er ChatGPT og hvernig virkar það?

ChatGPT er þjónusta byggð á gervigreind sem þú getur nálgast á internetinu eða í forriti. Þú getur notað ChatGPT við fjölbreytt verkefni, meðal annars til að skipuleggja og draga saman upplýsingar, aðstoða við þýðingar, forritun, rannsóknir og greiningu, ljúka fjölþrepa verkefnum með ólíkum verkfærum, greina eða búa til myndir, efla sköpunargáfu og hugmyndavinnu og sinna öðrum daglegum verkefnum. ChatGPT er hannað til að skilja og svara spurningum og fyrirmælum notenda með því að læra mynstur af miklu magni upplýsinga, þar á meðal texta, myndum, hljóði og myndskeiðum. 

Við þjálfun greinir líkanið tengsl í þessum gögnum, svo sem hvernig orð birtast yfirleitt saman í samhengi, og notar þann skilning til að spá fyrir um líklegasta næsta orð þegar svar er búið til, eitt orð í einu. Texta má umbreyta í smærri einingar, stundum nefndar „tókar“, sem geta táknað heil orð, orðhluta eða greinarmerki. Tókar eru grunneiningar textans sem líkanið vinnur úr. Á sama hátt læra líkön sem búa til annars konar efni, svo sem myndir, mynstur í tengslum mynddíla innbyrðis og við tilheyrandi myndatexta í þjálfunargögnunum.

Við námsferli líkansins (sem nefnist „þjálfun“) gæti það til dæmis fengið það verkefni að ljúka setningu á borð við: „Í stað þess að beygja til vinstri beygði hún ___.“ Snemma í þjálfuninni eru svör þess að mestu tilviljanakennd. Eftir því sem líkanið vinnur úr og lærir af miklu magni texta verður það þó betra í að greina mynstur og spá fyrir um líklegasta næsta orð. Þetta ferli er endurtekið með milljónum setninga til að skerpa skilning líkansins og auka nákvæmni þess.

Þar sem unnt er að ljúka setningu á marga trúverðuga vegu, svo sem „Í stað þess að beygja til vinstri beygði hún til hægri“, „við“ eða „til baka“, er ákveðin tilviljun óhjákvæmileg í svörum líkansins. Því getur sama spurningin gefið mismunandi svör þegar hún er lögð fyrir oftar en einu sinni.

Vélanámslíkön samanstanda af stórum talnasöfnum, svokölluðum „vigtum“ eða „stikum“, ásamt kóða sem túlkar og notar þessar tölur. Þessi líkön geyma hvorki né varðveita afrit af gögnunum sem þau eru þjálfuð á. Þess í stað eru gildi stika líkansins stillt lítillega eftir því sem það lærir, svo þau endurspegli mynstur sem það hefur greint. Í fyrra dæminu fór líkanið úr því að spá fyrir um tilviljanakennd orð í að spá með meiri nákvæmni, ekki með því að geyma þjálfunarsetningarnar heldur með því að uppfæra innri stika sína. Líkanið varðveitir ekki afrit af setningum, myndum eða hljóði sem það vinnur úr við þjálfun. ChatGPT „afritar og límir“ ekki úr þjálfunargögnunum. Þetta má líkja við kennara sem getur, eftir umfangsmikið nám, útskýrt hugtök með því að skilja tengsl hugmynda án þess að læra upprunalega efnið utan að eða endurtaka það orðrétt. Þegar líkanið býr til svar við beiðni notanda notar það þessar lærðu vigtir til að spá fyrir um og skapa nýtt efni.

Hvers konar upplýsingar eru notaðar til að kenna ChatGPT?

Úr efni á internetinu notum við aðeins upplýsingar sem eru öllum aðgengilegar þar án endurgjalds og takmarkana. Þetta getur meðal annars verið opinberlega aðgengilegar vefsíður, umræðusvæði, blogg, færslur og annað efni á netinu sem almenningur hefur aðgang að. Ef þú tekur til dæmis þátt í umræðum á netinu sem eru öllum opnar eða birtir opinbert blogg eða aðra færslu kunnum við að nota það aðgengilega efni til að þjálfa líkön. Við gerum þó ráðstafanir til að draga úr vinnslu persónuupplýsinga í þjálfunarferlinu.  Þegar við söfnum opinberlega aðgengilegu efni af internetinu sækjum við ekki vísvitandi gögn úr heimildum sem vitað er að eru bak við greiðsluveggi eða af myrkranetinu. Við notum einnig síur til að fjarlægja efni sem við viljum ekki að líkönin okkar læri af, svo sem hatursorðræðu, efni fyrir fullorðna, vefsvæði sem safna saman persónuupplýsingum og ruslpóst. Upplýsingarnar sem eftir standa eru síðan notaðar til að þjálfa líkönin okkar. 

Eigendur vefsvæða geta stýrt því hvort nálgast megi opinberlega aðgengilegt efni á vefsvæðum þeirra til þjálfunar með stöðluðum vefstýringum, svo sem robots.txt, til að banna GPTBot að skríða yfir efnið í þeim tilgangi að þjálfa líkönin okkar. Við veitum leiðbeiningar til að aðstoða eigendur vefsvæða við að stýra samskiptum vefsvæða þeirra og efnis við gervigreindarkerfi okkar. 

Við notum einnig upplýsingar frá samstarfsaðilum til að þjálfa og bæta líkönin okkar. Þetta getur falið í sér upplýsingar í gagnasöfnum sem við fáum aðgang að samkvæmt samningum við þriðju aðila, auk upplýsinga sem mannlegir þjálfarar og rannsakendur veita eða búa til þegar stefnur okkar og samningar heimila það. Þetta bætir gæði, öryggi og afköst líkananna okkar. Þessar heimildir geta innihaldið texta, myndir, hljóð, myndskeið eða aðrar tegundir gagna, allt eftir gagnasafninu.

Við notum einnig gervigögn í vaxandi mæli í sumum þjálfunarferlum. Við kunnum til dæmis að nota upplýsingar og líkönin okkar til að búa til gervifyrirmæli, fjöltyngd dæmi eða annað þjálfunarefni. Gervigögn geta bætt afköst líkana, meðal annars með því að bæta við þjálfunargögn á sviðum þar sem gögn eru af skornum skammti eða ójafnvægi er í þeim. Þau geta einnig stutt aðferðir við þróun líkana sem efla persónuvernd.

Eru persónuupplýsingar notaðar til að kenna ChatGPT?

Stór hluti efnis á netinu inniheldur upplýsingar um fólk og því kunna persónuupplýsingar að vera í þjálfunargögnum okkar fyrir tilviljun. Við gerum þó ráðstafanir til að draga úr vinnslu persónuupplýsinga í þjálfunarferlinu.

Við notum þjálfunargögn til að þróa getu líkansins, svo sem til spádóma, raka og lausnar vandamála, en ekki til að búa til persónusnið, hafa samband við einstaklinga eða sérsníða auglýsingar að þeim.

Í sumum tilvikum kunna líkön að læra af persónuupplýsingum til að skilja hvernig atriði á borð við nöfn og heimilisföng virka í tungumáli eða til að bera kennsl á opinberar persónur og vel þekkta aðila. Þetta hjálpar líkaninu að búa til nákvæmari svör sem hæfa samhenginu betur.

Hvernig eru persónuupplýsingar verndaðar við þjálfun?

Við grípum til virkra ráðstafana til að takmarka vinnslu persónuupplýsinga við þjálfun. Við útilokum til dæmis þekktar heimildir sem safna saman miklu magni persónuupplýsinga, notum síur til að draga úr persónuupplýsingum í þjálfunarferlinu og gerum ráðstafanir til að finna og fjarlægja tvítekið efni svo minni hætta sé á að þjálfunargögn séu endurtekin. Auk þess þjálfum við líkönin okkar í að forðast að svara beiðnum um einkaupplýsingar eða viðkvæmar upplýsingar um einstaklinga. 

Hve lengi við varðveitum upplýsingar

Við varðveitum upplýsingar í þjálfunargögnum aðeins eins lengi og telst með sanngjörnum hætti nauðsynlegt í þeim tilgangi sem lýst er í þessari grein og persónuverndarstefnu okkar, meðal annars til að þróa og bæta líkönin okkar og vegna tengdra vísindarannsókna. Varðveislan er endurskoðuð reglulega til að tryggja að hún sé áfram nauðsynleg og varðveislutíminn fer eftir tegund upplýsinganna og því hvernig þær eru notaðar. Við ákvörðun varðveislutíma lítum við meðal annars til tilgangs vinnslunnar, magns, eðlis og viðkvæmni upplýsinganna, hugsanlegrar hættu á tjóni vegna óheimillar notkunar eða miðlunar og lagaskyldna sem hvíla á okkur.

Hvernig samræmist þróun ChatGPT persónuverndarlögum?

Við notum þjálfunarupplýsingar með lögmætum hætti. Grunnlíkön okkar knýja fjölbreytt og gagnleg forrit, þar á meðal aðgengisverkfæri, þjónustuver, hugbúnaðarþróun, einstaklingsmiðað nám og vísindarannsóknir. Þessi geta byggist á umfangsmiklum þjálfunargögnum, þar á meðal opinberlega aðgengilegum upplýsingum og upplýsingum frá samstarfsaðilum. Við beitum öryggisráðstöfunum í öllu þjálfunarferlinu, þar á meðal ráðstöfunum sem ætlað er að draga úr vinnslu persónuupplýsinga og minnka áhættu, eins og lýst er í þessari grein. Við byggjum söfnun og notkun persónuupplýsinga í þjálfunarupplýsingum á lögmætum hagsmunum samkvæmt persónuverndarlögum á borð við GDPR. Þar á meðal er þjálfun og endurbætur líkana okkar fyrir notendur og samfélagið í heild, í samræmi við markmið okkar um að tryggja að almenn gervigreind nýtist öllum, eins og nánar er útskýrt í persónuverndarstefnu okkar. Við höfum framkvæmt mat á áhrifum á persónuvernd til að tryggja betur að við söfnum og notum þessar upplýsingar með lögmætum og ábyrgum hætti.

Hvenær upplýsingum kann að vera miðlað eða þær fluttar

Við „seljum“ ekki persónuupplýsingar og miðlum persónuupplýsingum í þjálfunargögnum aðeins við þær afmörkuðu aðstæður sem lýst er í persónuverndarstefnu okkar. Við kunnum til dæmis að deila upplýsingum með tengdum félögum, birgjum og þjónustuveitendum sem styðja við þróun, prófanir og endurbætur líkana okkar. Við kunnum einnig að miðla upplýsingum ef við teljum í góðri trú að það sé nauðsynlegt til að uppfylla lagaskyldu eða vernda réttindi okkar, öryggi og vernd, sem og réttindi, öryggi og vernd notenda okkar, starfsfólks eða almennings, eins og lýst er í persónuverndarstefnu okkar.

Þar sem innviðir okkar eru alþjóðlegir kunna persónuupplýsingar í þjálfunargögnum að vera unnar í löndum utan EES, Sviss eða Bretlands, þar á meðal í Bandaríkjunum. Þegar það á við beitum við viðeigandi verndarráðstöfunum, svo sem ákvörðunum um fullnægjandi vernd eða stöðluðum samningsákvæðum, eins og lýst er í persónuverndarstefnu okkar.

Réttindi þín og hvernig þú getur nýtt þau

Við svörum andmælum og sambærilegum beiðnum um nýtingu réttinda. Vegna tungumálanáms kunna svör ChatGPT stundum að innihalda persónuupplýsingar um einstaklinga sem upplýsingar um birtast margsinnis á opinbera internetinu, til dæmis opinberar persónur. Einstaklingar í tilteknum lögsögum geta andmælt vinnslu líkana okkar á persónuupplýsingum sínum eða lagt fram aðrar beiðnir um réttindi skráðra einstaklinga í Persónuverndargáttinni okkar. Þú getur einnig nýtt þessi réttindi með því að hafa samband við privacy@openai.com.

Til að auðvelda okkur að meta og svara beiðninni skaltu veita nægar upplýsingar til að við skiljum hvaða persónuupplýsingar hún varðar, svo sem nafn þitt, viðeigandi vefslóðir, tiltekin dæmi um úttak líkans eða aðrar upplýsingar sem hjálpa til við að bera kennsl á málið. Í sumum tilvikum kunnum við að biðja þig um að staðfesta auðkenni þitt eða að upplýsingarnar tengist þér áður en við getum brugðist við. Nánari upplýsingar um hvernig leggja má fram slíkar beiðnir, þar á meðal bestu starfsvenjur og hvernig farið er yfir beiðnir, er að finna í grein Hjálparmiðstöðvarinnar um að fjarlægja persónuupplýsingar úr ChatGPT. Við förum yfir beiðnir í samræmi við gildandi persónuverndarlög og svörum innan þeirra lögbundnu tímamarka sem eiga við.

Hafðu í huga að samkvæmt persónuverndarlögum eru sum réttindi ekki fortakslaus. Við getum til dæmis ekki alltaf orðið við beiðni ef við getum ekki sannreynt viðeigandi upplýsingar, ef beiðnin varðar ekki persónuupplýsingar sem OpenAI vinnur, ef undanþága á við eða ef önnur lögmæt ástæða er fyrir því. Beiðnir eru metnar í hverju tilviki fyrir sig og kann að þurfa að vega persónuverndarréttindi á móti öðrum mikilvægum sjónarmiðum, svo sem tjáningarfrelsi og almannahagsmunum.

Við leggjum þó áherslu á að vernda persónuupplýsingar og fylgja öllum gildandi persónuverndarlögum. Ef þú telur að við höfum ekki tekið með fullnægjandi hætti á máli þínu áttu rétt á að leggja fram kvörtun hjá eftirlitsstofnun á þínu svæði.

Nánari upplýsingar um starfshætti OpenAI varðandi persónuupplýsingar sem við söfnum frá þér eða um þig þegar þú notar vefsvæði okkar, forrit og þjónustu er að finna í persónuverndarstefnu okkar.

Var þessi grein gagnleg?