OpenAI:s grundmodeller, däribland modellerna bakom ChatGPT, utvecklas med hjälp av tre huvudsakliga informationskällor: (1) information som är allmänt tillgänglig på internet, (2) information som vi får tillgång till genom samarbeten med tredje part och (3) information som våra användare, mänskliga tränare och forskare tillhandahåller eller genererar.
Utvecklingen av grundmodeller som de som används i ChatGPT omfattar flera steg, däribland förberedelse av träningsdata, förträning och efterträning samt löpande utvärdering och förbättring efter lanseringen. Olika typer av information kan användas i dessa steg för olika ändamål, bland annat för att förbättra modellernas prestanda, tillförlitlighet och säkerhet.
Den här artikeln ger en översikt över den information vi använder för att utveckla modellerna, hur vi samlar in och använder informationen i enlighet med integritetslagstiftningen samt vilka skyddsåtgärder vi tillämpar under hela träningsprocessen. Läs vår Integritetspolicy och den här artikeln i vårt hjälpcenter för att förstå hur vi samlar in och använder information från användare av våra tjänster, inklusive hur du väljer bort att konversationer i ChatGPT används för att förbättra våra modeller.
Vad är ChatGPT och hur fungerar det?
ChatGPT är en AI-baserad tjänst som du kan använda via internet eller en app. Du kan använda ChatGPT för många olika uppgifter, bland annat för att ordna och sammanfatta information, få hjälp med översättningar, programmering, forskning och analys, utföra uppgifter i flera steg med olika verktyg, analysera eller generera bilder, få inspiration till kreativitet och idéer samt för andra vardagliga aktiviteter. ChatGPT är utformat för att förstå och besvara användarnas frågor och instruktioner genom att lära sig mönster från stora mängder information, däribland text, bilder, ljud och video.
Under träningen analyserar modellen samband i dessa data – till exempel hur ord vanligtvis förekommer tillsammans i ett sammanhang – och använder den förståelsen för att förutsäga det mest sannolika nästkommande ordet när den genererar ett svar, ett ord i taget. Text kan delas upp i mindre enheter, ibland kallade ”token”, som kan motsvara hela ord, delar av ord eller skiljetecken. Token är textens byggstenar som modellen bearbetar. På liknande sätt lär sig modeller som genererar andra typer av innehåll, exempelvis bilder, mönster i hur bildpunkter förhåller sig till varandra och till tillhörande bildtexter i träningsdata.
Under modellens inlärningsprocess (som kallas ”träning”) kan modellen till exempel få i uppgift att slutföra en mening som: ”Instead of turning left, she turned ___.” Tidigt i träningen är svaren till stor del slumpmässiga. Men allt eftersom modellen bearbetar och lär sig från stora mängder text blir den bättre på att känna igen mönster och förutsäga det mest sannolika nästkommande ordet. Processen upprepas för miljontals meningar för att förfina modellens förståelse och förbättra dess precision.
Eftersom en mening kan slutföras på flera rimliga sätt – till exempel ”Instead of turning left, she turned right”, ”around” eller ”back” – finns det ett inneboende mått av slumpmässighet i hur modellen svarar. Samma fråga kan därför ge olika svar vid olika tillfällen.
Maskininlärningsmodeller består av stora uppsättningar tal, så kallade ”vikter” eller ”parametrar”, samt kod som tolkar och använder dessa tal. Modellerna lagrar eller behåller inte kopior av de data som de tränas på. När en modell lär sig justeras i stället värdena för dess parametrar något för att återspegla mönster som den har identifierat. I det tidigare exemplet gick modellen från att förutsäga slumpmässiga ord till att göra mer träffsäkra förutsägelser – inte genom att lagra träningsmeningarna, utan genom att uppdatera sina interna parametrar. Modellen behåller inte kopior av meningar, bilder eller ljud som den bearbetar under träningen. ChatGPT ”kopierar och klistrar” inte från sina träningsdata. Det kan jämföras med hur en lärare efter omfattande studier kan förklara begrepp genom att förstå sambanden mellan idéer, utan att memorera eller återge originalmaterialet ordagrant. När modellen genererar ett svar på en användares begäran använder den dessa inlärda vikter för att förutsäga och skapa nytt innehåll.
Vilken typ av information används för att lära ChatGPT?
När det gäller offentligt tillgängligt innehåll på internet använder vi endast information som är fritt och öppet tillgänglig där. Det kan omfatta offentligt tillgängliga webbsidor, forum, bloggar, inlägg och annat offentligt tillgängligt innehåll på internet. Om du exempelvis deltar i ett offentligt diskussionsforum på internet eller publicerar en offentlig blogg eller ett annat offentligt inlägg kan vi använda det offentligt tillgängliga innehållet för modellträning. Vi vidtar dock åtgärder för att minska behandlingen av personuppgifter i träningsprocessen. När vi samlar in offentligt tillgängligt innehåll från internet hämtar vi inte avsiktligt data från källor som vi vet ligger bakom betalväggar eller från det mörka nätet. Dessutom använder vi filter för att ta bort material som vi inte vill att våra modeller ska lära sig från, till exempel hatpropaganda, vuxeninnehåll, webbplatser som sammanställer personuppgifter och skräppost. Den återstående informationen används sedan för att träna våra modeller.
Webbplatsägare kan styra om offentligt tillgängligt innehåll på deras webbplatser får hämtas för träning genom att använda vanliga webbkontroller, exempelvis robots.txt, för att blockera GPTBot, som kan genomsöka offentligt tillgängligt innehåll för att bidra till träningen av våra modeller. Vi erbjuder vägledning som hjälper webbplatsägare att hantera hur deras webbplatser och innehåll interagerar med våra AI-system.
Vi använder även information från tredjepartspartner för att träna och förbättra våra modeller. Det kan omfatta information i datauppsättningar som vi får tillgång till genom avtal med tredje part samt information som tillhandahålls eller genereras av mänskliga tränare och forskare när våra policyer och avtal tillåter det. Detta bidrar till att förbättra våra modellers kvalitet, säkerhet och prestanda. Beroende på datauppsättningen kan dessa källor innehålla text, bilder, ljud, video eller andra datatyper.
Vi använder också syntetiska data i allt fler av våra träningsprocesser. Vi kan till exempel använda information och våra modeller för att generera syntetiska promptar, flerspråkiga exempel eller annat träningsmaterial. Syntetiska data kan bidra till bättre modellprestanda, bland annat genom att komplettera träningsdata inom områden där det finns ont om data eller där de är obalanserade. De kan även möjliggöra integritetsfrämjande metoder för modellutveckling.
Används personuppgifter för att lära ChatGPT?
En betydande del av innehållet på internet innehåller information om människor, så våra träningsdata kan oavsiktligt omfatta personuppgifter. Vi vidtar dock åtgärder för att minska behandlingen av personuppgifter i träningsprocessen.
Vi använder träningsdata för att utveckla modellens förmågor – exempelvis förutsägelse, resonemang och problemlösning – inte för att skapa profiler av enskilda personer, kontakta dem eller anpassa annonser efter dem.
I vissa fall kan modeller lära sig från personuppgifter för att förstå hur exempelvis namn och adresser fungerar i språket eller för att känna igen offentliga personer och välkända organisationer och företeelser. Det hjälper modellen att generera mer korrekta och sammanhangsanpassade svar.
Hur skyddas personuppgifter under träningen?
Vi vidtar aktiva åtgärder för att begränsa behandlingen av personuppgifter under träningen. Vi utesluter till exempel kända källor som sammanställer stora mängder personuppgifter, använder filtrering för att minska mängden personuppgifter i träningsprocessen samt identifierar och tar bort dubbletter för att minska risken att träningsdata upprepas. Dessutom tränar vi våra modeller att undvika att besvara förfrågningar om privat eller känslig information om enskilda personer.
Hur länge vi lagrar information
Vi lagrar information i träningsdata endast så länge som det rimligen behövs för de ändamål som beskrivs i den här artikeln och vår Integritetspolicy, däribland för att utveckla och förbättra våra modeller och för relaterad vetenskaplig forskning. Lagringen granskas regelbundet för att säkerställa att den fortfarande är nödvändig och varierar beroende på typen av information och hur den används. När vi fastställer lagringstiden tar vi hänsyn till faktorer som ändamålet med behandlingen, informationens mängd, art och känslighet, den potentiella risken för skada vid obehörig användning eller utlämning samt de rättsliga skyldigheter som gäller för oss.
Hur följer utvecklingen av ChatGPT integritetslagstiftningen?
Vi använder träningsinformation på ett lagligt sätt. Våra grundmodeller driver ett brett utbud av användbara tillämpningar, däribland hjälpmedel för tillgänglighet, kundsupport, programvaruutveckling, individanpassad utbildning och vetenskaplig forskning. Dessa förmågor är beroende av storskaliga träningsdata, däribland offentligt tillgänglig information och information från tredjepartspartner. Vi tillämpar skyddsåtgärder under hela träningsprocessen, bland annat åtgärder som ska minska behandlingen av personuppgifter och begränsa risker, enligt beskrivningen i den här artikeln. Vi grundar vår insamling och användning av personuppgifter som ingår i träningsinformationen på berättigade intressen enligt integritetslagstiftning som GDPR. Det omfattar att träna och förbättra våra modeller för användarna och samhället i stort, i linje med vårt uppdrag att se till att artificiell generell intelligens gynnar alla. Detta förklaras närmare i vår Integritetspolicy. Vi har genomfört en konsekvensbedömning avseende dataskydd för att bidra till att säkerställa att vi samlar in och använder informationen på ett lagligt och ansvarsfullt sätt.
När information kan delas eller överföras
Vi ”säljer” inte personuppgifter och lämnar endast ut personuppgifter i träningsdata under de begränsade omständigheter som beskrivs i vår Integritetspolicy. Vi kan till exempel dela information med närstående bolag, leverantörer och tjänsteleverantörer som hjälper oss att utveckla, testa och förbättra våra modeller. Vi kan även lämna ut information om vi i god tro bedömer att det är nödvändigt för att uppfylla en rättslig skyldighet eller skydda våra egna och våra användares, anställdas eller allmänhetens rättigheter och trygghet, enligt beskrivningen i vår Integritetspolicy.
Eftersom vår infrastruktur är global kan personuppgifter i träningsdata behandlas i länder utanför EES, Schweiz eller Storbritannien (inklusive USA). När detta sker tillämpar vi lämpliga skyddsåtgärder, exempelvis beslut om adekvat skyddsnivå eller standardavtalsklausuler, enligt beskrivningen i vår Integritetspolicy.
Dina rättigheter och hur du utövar dem
Vi svarar på invändningar och liknande begäranden om att utöva rättigheter. Eftersom ChatGPT lär sig språk kan svaren ibland innehålla personuppgifter om personer vars uppgifter förekommer många gånger på det öppna internet, till exempel offentliga personer. Personer i vissa jurisdiktioner kan invända mot att deras personuppgifter behandlas av våra modeller eller lämna in andra begäranden om registrerades rättigheter via vår Integritetsportal. Du kan också utöva dessa rättigheter genom att kontakta privacy@openai.com.
För att hjälpa oss att bedöma och besvara din begäran ska du lämna tillräcklig information för att vi ska förstå vilka personuppgifter den gäller, exempelvis ditt namn, relevanta webbadresser, specifika exempel på modellens utdata eller andra uppgifter som hjälper oss att identifiera problemet. I vissa fall kan vi be dig att styrka din identitet eller bekräfta att informationen gäller dig innan vi kan vidta åtgärder. Mer information om hur du skickar in sådana begäranden, inklusive rekommenderade metoder och hur begäranden granskas, finns i vår artikel i Hjälpcenter om borttagning av personuppgifter från ChatGPT. Vi granskar begäranden i enlighet med tillämplig integritetslagstiftning och svarar inom de tidsfrister som lagen föreskriver.
Observera att vissa rättigheter enligt integritetslagstiftningen inte är absoluta. Vi kanske exempelvis inte kan tillmötesgå en begäran om vi inte kan verifiera den relevanta informationen, om begäran inte gäller personuppgifter som behandlas av OpenAI, om ett undantag gäller eller om vi har någon annan rättslig grund för att inte göra det. Begäranden bedöms från fall till fall och kan innebära en avvägning mellan integritetsrättigheter och andra viktiga intressen, såsom yttrandefriheten och allmänintresset.
Vi strävar dock efter att prioritera skyddet av personuppgifter och följa all tillämplig integritetslagstiftning. Om du anser att vi inte har hanterat ett ärende på ett tillfredsställande sätt har du rätt att lämna in ett klagomål till din lokala tillsynsmyndighet.
Mer information om OpenAI:s hantering av personuppgifter som vi samlar in från eller om dig när du använder vår webbplats, våra appar och tjänster finns i vår Integritetspolicy.
