OpenAI
Denne side er maskinoversat. Se den originale engelske artikel.

Sådan udvikles ChatGPT og vores grundmodeller

Få mere at vide om, hvordan vi udvikler vores modeller og anvender dem i produkter som ChatGPT

Opdateret: 3 days ago

OpenAI’s grundmodeller, herunder de modeller, der driver ChatGPT, udvikles ved hjælp af tre primære informationskilder: (1) oplysninger, der er offentligt tilgængelige på internettet, (2) oplysninger, som vi får adgang til gennem samarbejde med tredjeparter, og (3) oplysninger, som vores brugere, menneskelige undervisere og forskere leverer eller genererer.

Udviklingen af grundmodeller som dem, der bruges i ChatGPT, omfatter flere faser, herunder klargøring af træningsdata, fortræning og eftertræning samt løbende evaluering og forbedring efter ibrugtagning. Forskellige typer oplysninger kan bruges i disse faser til forskellige formål, herunder til at forbedre modellernes ydeevne, pålidelighed og sikkerhed. 

Denne artikel giver et overblik over de oplysninger, vi bruger til at udvikle disse modeller, hvordan vi indsamler og bruger oplysningerne i overensstemmelse med databeskyttelseslovgivningen, og hvilke sikkerhedsforanstaltninger vi anvender gennem hele træningsprocessen. Du kan læse om, hvordan vi indsamler og bruger oplysninger fra brugere af vores tjenester, herunder hvordan du fravælger, at samtaler i ChatGPT bruges til at forbedre vores modeller, i vores privatlivspolitik og denne artikel i Hjælp.

Hvad er ChatGPT, og hvordan fungerer det?

ChatGPT er en tjeneste baseret på kunstig intelligens, som du kan bruge via internettet eller en app. Du kan bruge ChatGPT til en lang række opgaver, herunder at organisere og opsummere oplysninger, hjælpe med oversættelser, understøtte programmering, forskning og analyse, udføre opgaver i flere trin på tværs af værktøjer, analysere eller generere billeder, inspirere til kreativitet og idéer samt håndtere andre hverdagsaktiviteter. ChatGPT er udviklet til at forstå og besvare brugernes spørgsmål og instruktioner ved at lære mønstre fra store mængder oplysninger, herunder tekst, billeder, lyd og video. 

Under træningen analyserer modellen relationer i disse data – for eksempel hvordan ord typisk optræder sammen i en bestemt kontekst – og bruger denne forståelse til at forudsige det næste mest sandsynlige ord, når den genererer et svar, ét ord ad gangen. Tekst kan opdeles i mindre enheder, som undertiden kaldes »tokens«, og som kan repræsentere hele ord, dele af ord eller tegnsætning. Tokens er de byggesten i teksten, som modellen behandler. På samme måde lærer modeller, der genererer andre former for indhold såsom billeder, mønstre i, hvordan pixels hænger sammen med hinanden og med de tilknyttede billedtekster i træningsdataene.

Under modellens læringsproces (kaldet »træning«) kan den for eksempel få til opgave at færdiggøre en sætning som: »I stedet for at dreje til venstre drejede hun ___.« Tidligt i træningen er dens svar i høj grad tilfældige. Efterhånden som modellen behandler og lærer af en stor mængde tekst, bliver den dog bedre til at genkende mønstre og forudsige det mest sandsynlige næste ord. Denne proces gentages med millioner af sætninger for at forfine modellens forståelse og forbedre dens præcision.

Fordi en sætning kan færdiggøres på flere sandsynlige måder – for eksempel »I stedet for at dreje til venstre drejede hun til højre«, »rundt« eller »tilbage« – er der et iboende element af tilfældighed i modellens svar. Det betyder, at det samme spørgsmål kan give forskellige svar, når det stilles flere gange.

Maskinlæringsmodeller består af store mængder tal, der kaldes »vægte« eller »parametre«, samt kode, der fortolker og bruger disse tal. Disse modeller gemmer eller opbevarer ikke kopier af de data, de trænes på. I stedet justeres værdierne af modellens parametre en smule, efterhånden som den lærer, så de afspejler de mønstre, den har identificeret. I det tidligere eksempel blev modellen bedre til at gå fra at forudsige tilfældige ord til at lave mere præcise forudsigelser – ikke ved at gemme træningssætningerne, men ved at opdatere sine interne parametre. Modellen opbevarer ikke kopier af de sætninger, billeder eller lydoptagelser, som den behandler under træningen. ChatGPT »kopierer og indsætter« ikke fra sine træningsdata. Det kan sammenlignes med, hvordan en lærer efter omfattende studier kan forklare begreber ved at forstå sammenhængen mellem idéer uden at huske eller gengive det oprindelige materiale ordret. Når modellen genererer et svar på en brugers anmodning, bruger den disse indlærte vægte til at forudsige og skabe nyt indhold.

Hvilke typer oplysninger bruges til at træne ChatGPT?

Når det gælder offentligt tilgængeligt indhold på internettet, bruger vi kun oplysninger, som er frit og åbent tilgængelige på internettet. Det kan omfatte offentligt tilgængelige websider, fora, blogs, opslag og andet offentligt tilgængeligt onlineindhold. Hvis du for eksempel deltager i et offentligt tilgængeligt debatforum på nettet eller offentliggør en blog eller et andet opslag, kan vi bruge dette offentligt tilgængelige indhold til træning af modeller. Vi træffer dog foranstaltninger for at begrænse behandlingen af personoplysninger i vores træningsproces.  Når vi indsamler offentligt tilgængeligt indhold fra internettet, indsamler vi ikke bevidst data fra kilder, som vi ved befinder sig bag betalingsmure, eller fra det mørke internet. Derudover bruger vi filtre til at fjerne materiale, som vi ikke ønsker, at vores modeller skal lære af, såsom hadefulde ytringer, voksenindhold, websteder, der samler personoplysninger, og spam. De resterende oplysninger bruges derefter til at træne vores modeller. 

Webstedsejere kan styre, om offentligt tilgængeligt indhold fra deres websteder må tilgås og bruges til træning, ved hjælp af almindelige webkontrolelementer såsom robots.txt til at blokere GPTBot, der kan gennemgå offentligt tilgængeligt indhold for at bidrage til træningen af vores modeller. Vi tilbyder vejledning, der hjælper webstedsejere med at styre, hvordan deres websteder og indhold interagerer med vores AI-systemer. 

Vi bruger også oplysninger fra tredjepartspartnere til at træne og forbedre vores modeller. Det kan omfatte oplysninger i datasæt, som vi får adgang til gennem aftaler med tredjeparter, samt oplysninger, der leveres eller genereres af menneskelige undervisere og forskere, når vores politikker og aftaler tillader det. Det bidrager til at forbedre vores modellers kvalitet, sikkerhed og ydeevne. Disse kilder kan indeholde tekst, billeder, lyd, video eller andre datatyper, afhængigt af datasættet.

Vi bruger også i stigende grad syntetiske data i visse træningsprocesser. Vi kan for eksempel bruge oplysninger og vores modeller til at generere syntetiske prompts, flersprogede eksempler eller andet træningsmateriale. Syntetiske data kan bidrage til at forbedre modellernes ydeevne, blandt andet ved at supplere træningsdata på områder, hvor data er sparsomme eller ulige fordelt, og kan også understøtte metoder til modeludvikling, der styrker beskyttelsen af privatlivet.

Bruges personoplysninger til at træne ChatGPT?

En betydelig del af indholdet på internettet omfatter oplysninger om personer, så vores træningsdata kan utilsigtet indeholde personoplysninger. Vi træffer dog foranstaltninger for at begrænse behandlingen af personoplysninger i vores træningsproces.

Vi bruger træningsdata til at udvikle modellens evner – såsom forudsigelse, ræsonnering og problemløsning – ikke til at opbygge profiler af personer, kontakte dem eller målrette annoncer mod dem.

I nogle tilfælde kan modeller lære af personoplysninger for at forstå, hvordan elementer som navne og adresser fungerer sprogligt, eller for at genkende offentlige personer og velkendte enheder. Det hjælper modellen med at generere mere præcise og kontekstuelt passende svar.

Hvordan beskyttes personoplysninger under træningen?

Vi træffer aktive foranstaltninger for at begrænse behandlingen af personoplysninger under træningen. Vi udelukker for eksempel kendte kilder, der samler store mængder personoplysninger, bruger filtre til at begrænse personoplysninger i træningsprocessen og identificerer og fjerner duplikeret indhold for at mindske risikoen for, at træningsdata gentages. Derudover træner vi vores modeller til at undgå at besvare anmodninger om private eller følsomme oplysninger om enkeltpersoner. 

Hvor længe vi opbevarer oplysninger

Vi opbevarer kun oplysninger i træningsdata, så længe det med rimelighed er nødvendigt til de formål, der er beskrevet i denne artikel og vores privatlivspolitik, herunder for at udvikle og forbedre vores modeller og til relateret videnskabelig forskning. Opbevaringen gennemgås regelmæssigt for at sikre, at den fortsat er nødvendig, og varigheden afhænger af typen af oplysninger, og hvordan de bruges. Når vi fastsætter opbevaringsperioden, tager vi hensyn til faktorer såsom formålet med at behandle oplysningerne, oplysningernes omfang, karakter og følsomhed, den potentielle risiko for skade ved uautoriseret brug eller videregivelse samt eventuelle juridiske forpligtelser, som vi er underlagt.

Hvordan overholder udviklingen af ChatGPT databeskyttelseslovgivningen?

Vi bruger træningsoplysninger lovligt. Vores grundmodeller driver en lang række nyttige anvendelser, herunder tilgængelighedsværktøjer, kundesupport, softwareudvikling, individuelt tilpasset undervisning og videnskabelig forskning. Disse funktioner er afhængige af træningsdata i stor skala, herunder offentligt tilgængelige oplysninger og oplysninger fra tredjepartspartnere. Vi anvender sikkerhedsforanstaltninger gennem hele træningsprocessen, herunder tiltag, der skal begrænse behandlingen af personoplysninger under træningen og mindske risici som beskrevet i denne artikel. Vi baserer vores indsamling og brug af personoplysninger, der indgår i træningsoplysninger, på legitime interesser i henhold til databeskyttelseslovgivning såsom GDPR. Det omfatter træning og forbedring af vores modeller til gavn for brugerne og samfundet generelt i overensstemmelse med vores mission om at sikre, at kunstig generel intelligens kommer alle til gode. Det forklares nærmere i vores privatlivspolitik. Vi har gennemført en konsekvensanalyse vedrørende databeskyttelse for at bidrage til at sikre, at vi indsamler og bruger disse oplysninger lovligt og ansvarligt.

Hvornår oplysninger kan deles eller overføres

Vi »sælger« ikke personoplysninger og videregiver kun personoplysninger i træningsdata under de begrænsede omstændigheder, der er beskrevet i vores privatlivspolitik. Vi kan for eksempel dele oplysninger med koncernforbundne selskaber, leverandører og tjenesteudbydere, der bidrager til at udvikle, teste og forbedre vores modeller. Vi kan også videregive oplysninger, hvis vi i god tro mener, at det er nødvendigt for at overholde en juridisk forpligtelse eller beskytte vores og vores brugeres, medarbejderes eller offentlighedens rettigheder og sikkerhed som beskrevet i vores privatlivspolitik.

Da vores infrastruktur er global, kan personoplysninger i træningsdata blive behandlet i lande uden for EØS, Schweiz eller Storbritannien (herunder i USA). Når det sker, anvender vi passende sikkerhedsforanstaltninger såsom afgørelser om tilstrækkeligheden af beskyttelsesniveauet eller standardkontraktbestemmelser som beskrevet i vores privatlivspolitik.

Dine rettigheder, og hvordan du udøver dem

Vi besvarer indsigelser og lignende anmodninger om udøvelse af rettigheder. Som følge af sprogindlæringen kan svar fra ChatGPT undertiden indeholde personoplysninger om personer, hvis oplysninger optræder mange gange på det offentligt tilgængelige internet (for eksempel offentlige personer). Personer i visse jurisdiktioner kan gøre indsigelse mod vores modellers behandling af deres personoplysninger eller fremsætte andre anmodninger om registreredes rettigheder via vores privatlivsportal. Du kan også udøve disse rettigheder ved at skrive til privacy@openai.com.

For at hjælpe os med at vurdere og besvare din anmodning skal du give os tilstrækkelige oplysninger til, at vi kan forstå, hvilke personoplysninger den vedrører, såsom dit navn, relevante webadresser, konkrete eksempler på modeloutput eller andre oplysninger, der kan hjælpe med at identificere problemet. I nogle tilfælde kan vi bede dig om at bekræfte din identitet eller bekræfte, at oplysningerne vedrører dig, før vi kan handle. Du kan læse mere om, hvordan du indsender sådanne anmodninger, herunder anbefalede fremgangsmåder og hvordan anmodninger gennemgås, i vores artikel i Hjælp om fjernelse af personoplysninger fra ChatGPT. Vi gennemgår anmodninger i overensstemmelse med gældende databeskyttelseslovgivning og svarer inden for de gældende lovbestemte frister.

Vær opmærksom på, at visse rettigheder i henhold til databeskyttelseslovgivningen muligvis ikke er ubetingede. Vi kan for eksempel være ude af stand til at efterkomme en anmodning, hvis vi ikke kan bekræfte de relevante oplysninger, hvis anmodningen ikke vedrører personoplysninger, som OpenAI behandler, hvis en undtagelse gælder, eller hvis vi har en anden lovlig grund til ikke at gøre det. Anmodninger vurderes individuelt og kan indebære en afvejning af retten til privatliv over for andre væsentlige hensyn såsom ytringsfriheden og offentlighedens interesse.

Vi bestræber os dog på at prioritere beskyttelsen af personoplysninger og overholde al gældende databeskyttelseslovgivning. Hvis du mener, at vi ikke har håndteret et problem på en tilfredsstillende måde, har du ret til at indgive en klage til din lokale tilsynsmyndighed.

Du kan læse mere om OpenAI’s praksis vedrørende personoplysninger, som vi indsamler fra eller om dig, når du bruger vores websted, apps og tjenester, i vores privatlivspolitik.

Var denne artikel nyttig?