OpenAI
Þessi síða var vélþýdd. Skoða upprunalegu ensku greinina.

Hvernig ChatGPT og grunnlíkön okkar eru þróuð

Kynntu þér hvernig við þróum líkön okkar og notum þau í vörum eins og ChatGPT

Uppfært: 8 days ago

Grunnlíkön OpenAI, þar á meðal líkönin sem knýja ChatGPT, eru þróuð með þremur meginheimildum upplýsinga: (1) upplýsingum sem eru aðgengilegar opinberlega á internetinu, (2) upplýsingum sem við fáum aðgang að í samstarfi við þriðju aðila og (3) upplýsingum sem notendur okkar, mannlegir þjálfarar og rannsakendur veita eða búa til.

Þróun grunnlíkana á borð við þau sem notuð eru í ChatGPT fer fram í nokkrum áföngum, þar á meðal undirbúningi þjálfunargagna, forþjálfun og eftirþjálfun, auk stöðugs mats og umbóta eftir að þau eru tekin í notkun. Mismunandi tegundir upplýsinga kunna að vera notaðar á þessum stigum í ýmsum tilgangi, þar á meðal til að bæta frammistöðu, áreiðanleika og öryggi líkana. 

Í þessari grein er gefið yfirlit yfir upplýsingarnar sem við notum til að þróa þessi líkön, hvernig við söfnum og notum þær í samræmi við persónuverndarlög og hvaða verndarráðstafanir við beitum í öllu þjálfunarferlinu. Til að skilja hvernig við söfnum og notum upplýsingar frá notendum þjónustu okkar, þar á meðal hvernig hægt er að afþakka að samtöl við ChatGPT séu notuð til að bæta líkönin okkar, skaltu lesa persónuverndarstefnu okkar og þessa grein í Hjálparmiðstöð.

Hvað er ChatGPT og hvernig virkar það?

ChatGPT er þjónusta byggð á gervigreind sem þú getur notað í gegnum internetið eða app. Þú getur notað ChatGPT í fjölbreytt verkefni, svo sem að skipuleggja og draga saman upplýsingar, aðstoða við þýðingar, styðja við forritun, rannsóknir og greiningu, ljúka fjölþrepa verkefnum milli verkfæra, greina eða búa til myndir, kveikja sköpunargáfu og hugmyndir og sinna öðrum daglegum verkefnum. ChatGPT er hannað til að skilja og svara spurningum og fyrirmælum notenda með því að læra mynstur úr miklu magni upplýsinga, þar á meðal texta, myndum, hljóði og myndskeiðum. 

Við þjálfun greinir líkanið tengsl innan þessara gagna — til dæmis hvernig orð birtast venjulega saman í samhengi — og notar þann skilning til að spá fyrir um næsta líklegasta orð þegar það býr til svar, eitt orð í einu. Texta má breyta í smærri einingar, stundum kallaðar „tókar“, sem geta táknað heil orð, hluta orða eða greinarmerki. Tókar eru byggingareiningar texta sem líkanið vinnur úr. Á svipaðan hátt læra líkön sem búa til annars konar efni, svo sem myndir, mynstur í því hvernig pixlar tengjast hver öðrum og tengdum myndatextum í þjálfunargögnunum.

Til dæmis gæti líkanið, meðan það lærir (það sem kallast „þjálfun“), fengið það verkefni að ljúka setningu eins og: „Í stað þess að beygja til vinstri beygði hún ___“. Snemma í þjálfuninni eru svör þess að mestu tilviljanakennd. Eftir því sem líkanið vinnur úr og lærir af miklu magni texta verður það hins vegar betra í að þekkja mynstur og spá fyrir um næsta líklegasta orð. Þetta ferli er endurtekið yfir milljónir setninga til að fínstilla skilning þess og bæta nákvæmni.

Þar sem margar trúverðugar leiðir eru til að ljúka setningu — til dæmis „Í stað þess að beygja til vinstri beygði hún til hægri“, „við“ eða „til baka“ — er tilviljunarkenndur þáttur innbyggður í það hvernig líkanið svarar. Þess vegna getur sama spurning skilað ólíkum svörum í mismunandi fyrirspurnum.

Vélrænt námslíkön samanstanda af stórum talnasöfnum, sem kallast „vogir“ eða „færibreytur“, ásamt kóða sem túlkar og notar þessar tölur. Þessi líkön geyma hvorki né varðveita afrit af gögnunum sem þau eru þjálfuð á. Þess í stað breytast gildi færibreytna lítillega eftir því sem líkan lærir, til að endurspegla mynstur sem það hefur greint. Í fyrra dæminu batnaði líkanið frá því að spá fyrir um tilviljanakennd orð yfir í nákvæmari spár — ekki með því að geyma þjálfunarsetningarnar, heldur með því að uppfæra innri færibreytur sínar. Líkanið varðveitir ekki afrit af setningum, myndum eða hljóði sem það vinnur úr við þjálfun. ChatGPT „afritar og límir“ ekki úr þjálfunargögnum sínum — svipað og kennari sem getur, eftir umfangsmikið nám, útskýrt hugtök með því að skilja tengsl hugmynda án þess að leggja upprunalegt efni á minnið eða endurtaka það orðrétt. Þegar líkanið býr til svar við beiðni notanda notar það þessar lærðu vogir til að spá fyrir um og skapa nýtt efni.

Hvers konar upplýsingar eru notaðar til að kenna ChatGPT?

Að því er varðar opinbert efni á internetinu notum við aðeins upplýsingar sem eru frjálslega og opinskátt aðgengilegar á internetinu. Þetta getur meðal annars verið opinberar vefsíður, opinber umræðusvæði, opinber blogg, opinberar færslur og annað opinberlega aðgengilegt efni á netinu. Til dæmis, ef þú tekur þátt í opinberlega aðgengilegum umræðum á netinu eða birtir opinbert blogg eða aðra færslu, kunnum við að nota það opinberlega aðgengilega efni í þjálfun líkana. Við gerum þó ráðstafanir til að draga úr vinnslu persónuupplýsinga í þjálfunarferlinu.  Þegar við söfnum opinberlega aðgengilegu efni af internetinu söfnum við ekki vísvitandi gögnum frá heimildum sem vitað er að eru bak við greiðslumúra eða af hulduvefnum. Auk þess notum við síur til að fjarlægja efni sem við viljum ekki að líkönin okkar læri af, svo sem hatursorðræðu, efni fyrir fullorðna, síður sem safna saman persónuupplýsingum og ruslefni. Upplýsingarnar sem eftir standa eru síðan notaðar til að þjálfa líkönin okkar. 

Eigendur vefsvæða geta stýrt því hvort opinberlega aðgengilegt efni af síðum þeirra megi sækja til notkunar í þjálfun með stöðluðum vefstýringum, svo sem robots.txt til að banna GPTBot, sem kann að skríða opinberlega aðgengilegt efni til að hjálpa við þjálfun líkana okkar. Við veitum leiðbeiningar til að hjálpa eigendum vefsvæða að stýra því hvernig síður þeirra og efni tengjast gervigreindarkerfum okkar. 

Við notum einnig upplýsingar frá samstarfsaðilum þriðju aðila til að hjálpa til við að þjálfa og bæta líkönin okkar. Þetta getur falið í sér upplýsingar í gagnasöfnum sem við fáum aðgang að samkvæmt samningum við þriðju aðila, auk upplýsinga sem mannlegir þjálfarar og rannsakendur veita eða búa til, þar sem það er heimilt samkvæmt stefnum okkar og samningum. Þetta hjálpar til við að bæta gæði, öryggi og frammistöðu líkana okkar. Þessar heimildir geta innihaldið texta, myndir, hljóð, myndskeið eða aðrar gagnategundir, eftir því hvert gagnasafnið er.

Við notum einnig í auknum mæli tilbúin gögn í sumum þjálfunarferlum. Til dæmis kunnum við að nota upplýsingar og líkönin okkar til að búa til tilbúnar kvaðningar, fjöltyngd dæmi eða annað þjálfunarefni. Tilbúin gögn geta hjálpað til við að bæta frammistöðu líkana, meðal annars með því að bæta við þjálfunargögn á sviðum þar sem gögn eru fágæt eða ójafnvægi er í þeim, og geta einnig stutt aðferðir við þróun líkana sem efla persónuvernd.

Eru persónuupplýsingar notaðar til að kenna ChatGPT?

Verulegur hluti efnis á netinu fjallar um upplýsingar um fólk, þannig að þjálfunargögn okkar kunna fyrir tilviljun að innihalda persónuupplýsingar. Við gerum þó ráðstafanir til að draga úr vinnslu persónuupplýsinga í þjálfunarferlinu.

Við notum þjálfunargögn til að þróa getu líkansins — svo sem spágetu, rök og lausn vandamála — ekki til að búa til prófíla um einstaklinga, hafa samband við þá eða sérsníða auglýsingar að þeim.

Í sumum tilvikum kunna líkön að læra af persónuupplýsingum til að skilja hvernig atriði á borð við nöfn og heimilisföng virka í tungumáli, eða til að þekkja opinberar persónur og vel þekktar einingar. Þetta hjálpar líkaninu að búa til nákvæmari svör sem hæfa samhenginu betur.

Hvernig eru persónuupplýsingar verndaðar við þjálfun?

Við gerum virkar ráðstafanir til að takmarka vinnslu persónuupplýsinga við þjálfun. Til dæmis útilokum við þekktar heimildir sem safna saman miklu magni persónugagna, beitum síun til að draga úr persónuupplýsingum í þjálfunarferlinu og gerum ráðstafanir til að greina og fjarlægja tvítekið efni til að minnka hættu á endurtekningu þjálfunargagna. Auk þess þjálfum við líkönin okkar í að forðast að svara beiðnum um einkaupplýsingar eða viðkvæmar upplýsingar um einstaklinga. 

Hve lengi við varðveitum upplýsingar

Við varðveitum upplýsingar í þjálfunargögnum aðeins eins lengi og telst sanngjarnt og nauðsynlegt í þeim tilgangi sem lýst er í þessari grein og í persónuverndarstefnu okkar, þar á meðal til að þróa og bæta líkönin okkar og vegna tengdra vísindarannsókna. Varðveisla er endurskoðuð reglulega til að tryggja að hún sé áfram nauðsynleg og er mismunandi eftir tegund upplýsinga og því hvernig þær eru notaðar. Við ákvörðun um varðveislu lítum við til þátta á borð við tilgang okkar með vinnslu upplýsinganna, magn, eðli og viðkvæmni upplýsinganna, hugsanlega hættu á tjóni vegna óheimillar notkunar eða miðlunar og hvers kyns lagaskyldur sem hvíla á okkur.

Hvernig samræmist þróun ChatGPT persónuverndarlögum?

Við notum þjálfunarupplýsingar á lögmætan hátt. Grunnlíkönin okkar knýja fjölbreytt gagnleg forrit — þar á meðal aðgengisverkfæri, þjónustuver, hugbúnaðarþróun, sérsniðið nám og vísindarannsóknir. Þessi geta byggir á stórtækum þjálfunargögnum, þar á meðal opinberlega aðgengilegum upplýsingum og upplýsingum frá samstarfsaðilum þriðju aðila. Við beitum verndarráðstöfunum í öllu þjálfunarferlinu, þar á meðal ráðstöfunum sem ætlað er að draga úr vinnslu persónuupplýsinga í þjálfunarferlinu og minnka áhættu, eins og lýst er í þessari grein. Við byggjum söfnun og notkun okkar á persónuupplýsingum sem eru í þjálfunarupplýsingum á lögmætum hagsmunum samkvæmt persónuverndarlögum á borð við GDPR, þar á meðal til að þjálfa og bæta líkönin okkar fyrir notendur og samfélagið í heild, í samræmi við markmið okkar um að tryggja að almenn gervigreind gagnist öllum, eins og útskýrt er nánar í persónuverndarstefnu okkar. Við höfum lokið mati á áhrifum á persónuvernd til að stuðla að því að við söfnum og notum þessar upplýsingar með lögmætum og ábyrgum hætti.

Hvenær upplýsingum kann að vera miðlað eða þær fluttar

Við „seljum“ ekki persónuupplýsingar og miðlum persónuupplýsingum í þjálfunargögnum aðeins við þær takmörkuðu aðstæður sem lýst er í persónuverndarstefnu okkar. Til dæmis kunnum við að deila upplýsingum með tengdum félögum, birgjum og þjónustuveitendum sem styðja við þróun, prófun og umbætur á líkönum okkar. Við kunnum einnig að miðla upplýsingum í góðri trú um að slík aðgerð sé nauðsynleg til að uppfylla lagaskyldu eða til að vernda réttindi okkar, öryggi og vernd, sem og réttindi, öryggi og vernd notenda okkar, starfsfólks eða almennings, eins og lýst er í persónuverndarstefnu okkar.

Þar sem innviðir okkar eru hnattrænir kunna persónuupplýsingar í þjálfunargögnum að vera unnar í löndum utan EES, Sviss eða Bretlands (þar á meðal í Bandaríkjunum). Þegar þetta á sér stað beitum við viðeigandi verndarráðstöfunum, svo sem ákvörðunum um fullnægjandi vernd eða stöðluðum samningsákvæðum, eins og lýst er í persónuverndarstefnu okkar.

Réttindi þín og hvernig þú getur nýtt þau

Við svörum andmælum og sambærilegum beiðnum um réttindi. Vegna þess að ChatGPT lærir tungumál geta svör þess stundum innihaldið persónuupplýsingar um einstaklinga þar sem persónuupplýsingar þeirra koma margoft fyrir á opinbera internetinu (til dæmis opinberar persónur). Einstaklingar í tilteknum lögsögum geta andmælt vinnslu líkana okkar á persónuupplýsingum sínum eða lagt fram aðrar beiðnir um réttindi skráðra einstaklinga í gegnum Persónuverndargátt okkar. Þú getur einnig nýtt þessi réttindi með því að hafa samband við privacy@openai.com

Til að hjálpa okkur að meta beiðni þína og svara henni skaltu veita nægar upplýsingar til að við getum skilið hvaða persónuupplýsingar beiðnin varðar, svo sem nafn þitt, viðeigandi vefslóðir, tiltekin dæmi um úttak líkana eða önnur atriði sem hjálpa til við að bera kennsl á málið. Í sumum tilvikum kunnum við að biðja þig um að staðfesta auðkenni þitt eða staðfesta að upplýsingarnar tengist þér áður en við getum gripið til aðgerða. Frekari upplýsingar um hvernig á að senda inn slíkar beiðnir, þar á meðal bestu starfsvenjur og hvernig beiðnir eru yfirfarnar, er að finna í grein Hjálparmiðstöðvar okkar um fjarlægingu persónuupplýsinga úr ChatGPT. Við förum yfir beiðnir í samræmi við gildandi persónuverndarlög og svörum innan gildandi lögbundinna fresta.

Athugaðu að samkvæmt persónuverndarlögum kunna sum réttindi að vera háð takmörkunum. Til dæmis getur verið að við getum ekki orðið við beiðni ef við getum ekki staðfest viðkomandi upplýsingar, ef beiðnin varðar ekki persónuupplýsingar sem OpenAI vinnur, ef undanþága á við eða ef við höfum aðra lögmæta ástæðu til þess. Beiðnir eru metnar í hverju tilviki fyrir sig og kunna að fela í sér að vega persónuverndarréttindi á móti öðrum mikilvægum sjónarmiðum, svo sem tjáningarfrelsi og almannahagsmunum. 

Við leggjum okkur þó fram um að setja vernd persónuupplýsinga í forgang og fara að öllum gildandi persónuverndarlögum. Ef þér finnst við ekki hafa brugðist við máli með fullnægjandi hætti átt þú rétt á að leggja fram kvörtun hjá eftirlitsyfirvaldi á þínum stað.

Nánari upplýsingar um starfshætti OpenAI varðandi persónuupplýsingar sem við söfnum frá þér eða um þig þegar þú notar vefsvæði okkar, forrit og þjónustu er að finna í persónuverndarstefnu okkar.

Var þessi grein gagnleg?