De basismodellen van OpenAI, waaronder de modellen waarop ChatGPT draait, worden ontwikkeld aan de hand van drie primaire informatiebronnen: (1) informatie die openbaar beschikbaar is op internet, (2) informatie waartoe we in samenwerking met derden toegang krijgen en (3) informatie die onze gebruikers, menselijke trainers en onderzoekers verstrekken of genereren.
De ontwikkeling van basismodellen zoals die in ChatGPT omvat verschillende fasen, waaronder het voorbereiden van trainingsgegevens, pre-training en post-training, evenals voortdurende evaluatie en verbetering na de implementatie. In deze fasen kunnen verschillende soorten informatie voor diverse doeleinden worden gebruikt, waaronder het verbeteren van de prestaties, betrouwbaarheid en veiligheid van modellen.
Dit artikel geeft een overzicht van de informatie die we gebruiken om deze modellen te helpen ontwikkelen, hoe we die informatie in overeenstemming met privacywetgeving verzamelen en gebruiken, en welke waarborgen we tijdens het hele trainingsproces toepassen. Raadpleeg ons privacybeleid en dit artikel in het helpcentrum om te begrijpen hoe we informatie van gebruikers van onze diensten verzamelen en gebruiken, waaronder hoe u kunt voorkomen dat ChatGPT-gesprekken worden gebruikt om onze modellen te helpen verbeteren.
Wat is ChatGPT en hoe werkt het?
ChatGPT is een op kunstmatige intelligentie gebaseerde dienst die u via internet of een app kunt gebruiken. U kunt ChatGPT gebruiken voor allerlei taken, zoals informatie ordenen en samenvatten, helpen bij vertalingen, ondersteuning bieden bij programmeren, onderzoek en analyse, taken met meerdere stappen uitvoeren in verschillende tools, afbeeldingen analyseren of genereren, creativiteit en ideeën stimuleren en andere alledaagse activiteiten. ChatGPT is ontworpen om vragen en instructies van gebruikers te begrijpen en te beantwoorden door patronen te leren uit grote hoeveelheden informatie, waaronder tekst, afbeeldingen, audio en video.
Tijdens de training analyseert het model verbanden binnen deze gegevens, zoals de manier waarop woorden doorgaans samen in een bepaalde context voorkomen. Met dat inzicht voorspelt het bij het genereren van een antwoord telkens het waarschijnlijkste volgende woord. Tekst kan worden omgezet in kleinere eenheden, die soms "tokens" worden genoemd en hele woorden, delen van woorden of leestekens kunnen voorstellen. Tokens zijn de bouwstenen van tekst die het model verwerkt. Modellen die andere soorten content genereren, zoals afbeeldingen, leren op vergelijkbare wijze patronen in de verbanden tussen pixels onderling en tussen pixels en bijbehorende bijschriften in de trainingsgegevens.
Tijdens het leerproces van het model (de "training") kan het bijvoorbeeld de taak krijgen om een zin als deze aan te vullen: "In plaats van linksaf te slaan, sloeg ze ___ af." Aan het begin van de training zijn de antwoorden grotendeels willekeurig. Naarmate het model echter een grote hoeveelheid tekst verwerkt en daarvan leert, wordt het beter in het herkennen van patronen en het voorspellen van het waarschijnlijkste volgende woord. Dit proces wordt voor miljoenen zinnen herhaald om het begrip van het model te verfijnen en de nauwkeurigheid te verbeteren.
Omdat een zin op meerdere aannemelijke manieren kan worden aangevuld, bijvoorbeeld "In plaats van linksaf te slaan, sloeg ze rechtsaf", "draaide ze om" of "ging ze terug", bevatten de antwoorden van het model altijd een zekere mate van willekeur. Daardoor kan dezelfde vraag bij verschillende verzoeken andere antwoorden opleveren.
Machinelearningmodellen bestaan uit grote reeksen getallen, ook wel "gewichten" of "parameters" genoemd, en code die deze getallen interpreteert en gebruikt. Deze modellen slaan geen kopieën op van de gegevens waarop ze zijn getraind en bewaren die ook niet. Terwijl een model leert, worden de waarden van zijn parameters juist enigszins aangepast om de herkende patronen weer te geven. In het eerdere voorbeeld ging het model van het voorspellen van willekeurige woorden naar nauwkeurigere voorspellingen. Dat gebeurde niet door de trainingszinnen op te slaan, maar door de interne parameters bij te werken. Het model bewaart geen kopieën van de zinnen, afbeeldingen of audio die het tijdens de training verwerkt. ChatGPT "kopieert en plakt" niet uit de trainingsgegevens. Vergelijk het met een docent die na uitgebreide studie concepten kan uitleggen doordat die de verbanden tussen ideeën begrijpt, zonder het oorspronkelijke materiaal uit het hoofd te leren of woordelijk te reproduceren. Bij het genereren van een antwoord op een verzoek van een gebruiker gebruikt het model deze aangeleerde gewichten om nieuwe content te voorspellen en te creëren.
Welke soorten informatie worden gebruikt om ChatGPT te trainen?
Van de openbaar beschikbare internetcontent gebruiken we alleen informatie die vrij en openlijk toegankelijk is op internet. Dit kan bestaan uit openbaar beschikbare webpagina's, openbare forums, openbare blogs, openbare berichten en andere openbaar beschikbare onlinecontent. Als u bijvoorbeeld deelneemt aan een openbaar toegankelijk onlineforum of een openbare blog of ander openbaar bericht plaatst, kunnen we die openbaar toegankelijke content gebruiken om modellen te trainen. We nemen echter maatregelen om de verwerking van persoonsgegevens tijdens ons trainingsproces te beperken. Bij het verzamelen van openbaar beschikbare internetcontent verzamelen we niet opzettelijk gegevens uit bronnen waarvan bekend is dat ze achter een betaalmuur staan, of van het dark web. Daarnaast gebruiken we filters om materiaal te verwijderen waarvan we niet willen dat onze modellen ervan leren, zoals haatzaaiende uitlatingen, content voor volwassenen, websites die persoonsgegevens verzamelen en spam. De overgebleven informatie wordt vervolgens gebruikt om onze modellen te trainen.
Website-eigenaren kunnen met standaardwebfuncties, zoals robots.txt, bepalen of openbaar beschikbare content op hun websites mag worden gebruikt voor training. Daarmee kunnen ze GPTBot blokkeren, die openbaar beschikbare content kan crawlen om onze modellen te helpen trainen. We bieden richtlijnen waarmee website-eigenaren kunnen bepalen hoe hun websites en content met onze AI-systemen omgaan.
We gebruiken ook informatie van externe partners om onze modellen te helpen trainen en verbeteren. Dit kan informatie omvatten uit datasets waartoe we op grond van overeenkomsten met derden toegang hebben, evenals informatie die door menselijke trainers en onderzoekers wordt verstrekt of gegenereerd voor zover ons beleid en onze overeenkomsten dit toestaan. Dit helpt de kwaliteit, veiligheid en prestaties van onze modellen te verbeteren. Afhankelijk van de dataset kunnen deze bronnen tekst, afbeeldingen, audio, video of andere soorten gegevens bevatten.
We gebruiken in sommige trainingsprocessen ook steeds vaker synthetische gegevens. We kunnen bijvoorbeeld informatie en onze modellen gebruiken om synthetische prompts, meertalige voorbeelden of ander trainingsmateriaal te genereren. Synthetische gegevens kunnen de prestaties van modellen helpen verbeteren, onder meer door trainingsgegevens aan te vullen op gebieden waar weinig of onevenwichtig verdeelde gegevens beschikbaar zijn. Ze kunnen ook privacybevorderende benaderingen van modelontwikkeling ondersteunen.
Worden persoonsgegevens gebruikt om ChatGPT te trainen?
Een aanzienlijk deel van onlinecontent bevat informatie over mensen. Onze trainingsgegevens kunnen daarom incidenteel persoonsgegevens bevatten. We nemen echter maatregelen om de verwerking van persoonsgegevens tijdens ons trainingsproces te beperken.
We gebruiken trainingsgegevens om de capaciteiten van het model te ontwikkelen, zoals voorspellen, redenering en probleemoplossing, niet om profielen van personen op te stellen, contact met hen op te nemen of advertenties op hen af te stemmen.
In sommige gevallen kunnen modellen leren van persoonsgegevens om te begrijpen hoe elementen zoals namen en adressen in taal functioneren, of om publieke personen en bekende entiteiten te herkennen. Dit helpt het model nauwkeurigere antwoorden te genereren die beter bij de context passen.
Hoe worden persoonsgegevens tijdens de training beschermd?
We nemen actief maatregelen om de verwerking van persoonsgegevens tijdens de training te beperken. Zo sluiten we bekende bronnen uit die grote hoeveelheden persoonsgegevens verzamelen, passen we filters toe om persoonsgegevens in het trainingsproces te beperken en nemen we maatregelen om dubbele content te herkennen en te verwijderen, zodat het risico dat trainingsgegevens worden herhaald afneemt. Daarnaast trainen we onze modellen om niet te reageren op verzoeken om privégegevens of gevoelige informatie over personen.
Hoelang we informatie bewaren
We bewaren informatie in trainingsgegevens niet langer dan redelijkerwijs noodzakelijk is voor de doeleinden die in dit artikel en ons privacybeleid worden beschreven, waaronder het ontwikkelen en verbeteren van onze modellen en aanverwant wetenschappelijk onderzoek. De bewaartermijn wordt periodiek beoordeeld om na te gaan of bewaring nog steeds noodzakelijk is, en varieert afhankelijk van het soort informatie en de manier waarop deze wordt gebruikt. Bij het bepalen van de bewaartermijn houden we rekening met factoren zoals het doel waarvoor we de informatie verwerken, de hoeveelheid, aard en gevoeligheid van de informatie, het mogelijke risico op schade door ongeoorloofd gebruik of ongeoorloofde openbaarmaking en eventuele wettelijke verplichtingen waaraan we moeten voldoen.
Hoe voldoet de ontwikkeling van ChatGPT aan de privacywetgeving?
We gebruiken trainingsinformatie op rechtmatige wijze. Onze basismodellen ondersteunen allerlei nuttige toepassingen, waaronder toegankelijkheidstools, klantenondersteuning, softwareontwikkeling, gepersonaliseerd onderwijs en wetenschappelijk onderzoek. Deze mogelijkheden zijn afhankelijk van grootschalige trainingsgegevens, waaronder openbaar beschikbare informatie en informatie van externe partners. Tijdens het hele trainingsproces passen we waarborgen toe, waaronder maatregelen om de verwerking van persoonsgegevens in het trainingsproces te beperken en risico's te verminderen, zoals in dit artikel wordt beschreven. We baseren het verzamelen en gebruiken van persoonsgegevens in trainingsinformatie op gerechtvaardigde belangen volgens privacywetgeving zoals de AVG. Daaronder valt het trainen en verbeteren van onze modellen ten behoeve van gebruikers en de samenleving als geheel, in overeenstemming met onze missie om ervoor te zorgen dat kunstmatige algemene intelligentie iedereen ten goede komt. Dit wordt nader toegelicht in ons privacybeleid. We hebben een gegevensbeschermingseffectbeoordeling uitgevoerd om ervoor te helpen zorgen dat we deze informatie rechtmatig en verantwoord verzamelen en gebruiken.
Wanneer informatie kan worden gedeeld of doorgegeven
We "verkopen" geen persoonsgegevens en maken persoonsgegevens in trainingsgegevens alleen openbaar in de beperkte omstandigheden die in ons privacybeleid worden beschreven. We kunnen informatie bijvoorbeeld delen met gelieerde ondernemingen, leveranciers en dienstverleners die de ontwikkeling, het testen en de verbetering van onze modellen ondersteunen. We kunnen ook informatie openbaar maken als we te goeder trouw menen dat dit noodzakelijk is om aan een wettelijke verplichting te voldoen of om onze rechten, veiligheid en beveiliging en die van onze gebruikers, medewerkers of het publiek te beschermen, zoals beschreven in ons privacybeleid.
Omdat onze infrastructuur wereldwijd is, kunnen persoonsgegevens in trainingsgegevens worden verwerkt in landen buiten de EER, Zwitserland of het Verenigd Koninkrijk, waaronder de Verenigde Staten. Wanneer dit gebeurt, passen we passende waarborgen toe, zoals adequaatheidsbesluiten of standaardcontractbepalingen, zoals beschreven in ons privacybeleid.
Uw rechten en hoe u deze kunt uitoefenen
We reageren op verzoeken om bezwaar te maken en vergelijkbare verzoeken om rechten uit te oefenen. Doordat ChatGPT taal leert, kunnen antwoorden soms persoonsgegevens bevatten over personen van wie de persoonsgegevens meerdere keren op het openbare internet voorkomen, zoals publieke personen. Personen in bepaalde rechtsgebieden kunnen via ons privacy-portaal bezwaar maken tegen de verwerking van hun persoonsgegevens door onze modellen of andere verzoeken indienen om hun rechten als betrokkene uit te oefenen. U kunt deze rechten ook uitoefenen door contact op te nemen via privacy@openai.com.
Geef voldoende informatie zodat we kunnen beoordelen en begrijpen op welke persoonsgegevens uw verzoek betrekking heeft en erop kunnen reageren, zoals uw naam, relevante URL's, specifieke voorbeelden van modeluitvoer of andere gegevens die helpen het probleem vast te stellen. In sommige gevallen kunnen we u vragen uw identiteit te verifiëren of te bevestigen dat de informatie op u betrekking heeft voordat we actie kunnen ondernemen. Meer informatie over het indienen van deze verzoeken, waaronder aanbevolen werkwijzen en de manier waarop verzoeken worden beoordeeld, vindt u in ons artikel in het helpcentrum over het verwijderen van persoonsgegevens uit ChatGPT. We beoordelen verzoeken volgens de toepasselijke privacywetgeving en reageren binnen de geldende wettelijke termijnen.
Houd er rekening mee dat sommige rechten volgens de privacywetgeving mogelijk niet absoluut zijn. We kunnen bijvoorbeeld mogelijk niet aan een verzoek voldoen wanneer we de betreffende informatie niet kunnen verifiëren, het verzoek geen betrekking heeft op persoonsgegevens die OpenAI verwerkt, er een uitzondering van toepassing is of we een andere rechtmatige reden hebben om niet aan het verzoek te voldoen. Verzoeken worden per geval beoordeeld. Daarbij kunnen privacyrechten worden afgewogen tegen andere belangrijke belangen, zoals de vrijheid van meningsuiting en het algemeen belang.
We streven er echter naar de bescherming van persoonsgegevens voorop te stellen en alle toepasselijke privacywetgeving na te leven. Als u vindt dat we een kwestie niet afdoende hebben behandeld, hebt u het recht een klacht in te dienen bij uw lokale toezichthoudende autoriteit.
Raadpleeg ons privacybeleid voor meer informatie over de manier waarop OpenAI omgaat met persoonsgegevens die we van of over u verzamelen wanneer u onze website, applicaties en diensten gebruikt.
