OpenAI
Ez az oldal gépi fordítással készült. Tekintsd meg az eredeti angol nyelvű cikket.

A ChatGPT és alapmodelljeink fejlesztése

Tudjon meg többet arról, hogyan fejlesztjük modelljeinket, és hogyan alkalmazzuk őket olyan termékekben, mint a ChatGPT

Frissítve: 8 days ago

Az OpenAI alapmodelljeit – köztük a ChatGPT működését biztosító modelleket – három fő információforrás felhasználásával fejlesztjük: (1) az interneten nyilvánosan elérhető információk, (2) harmadik felekkel együttműködésben hozzáférhető információk, valamint (3) a felhasználóink, emberi betanítóink és kutatóink által rendelkezésre bocsátott vagy létrehozott információk.

A ChatGPT által használtakhoz hasonló alapmodellek fejlesztése több szakaszból áll, többek között a betanítási adatok előkészítéséből, az előtanításból és az utótanításból, valamint az üzembe helyezés utáni folyamatos értékelésből és továbbfejlesztésből. Ezekben a szakaszokban különböző típusú információkat használhatunk fel többféle célra, például a modellek teljesítményének, megbízhatóságának és biztonságának javítására. 

Ez a cikk áttekintést nyújt arról, hogy milyen információkat használunk fel e modellek fejlesztéséhez, hogyan gyűjtjük és használjuk fel őket az adatvédelmi jogszabályoknak megfelelően, valamint milyen óvintézkedéseket alkalmazunk a teljes betanítási folyamat során. Ha szeretné megérteni, hogyan gyűjtjük és használjuk fel a szolgáltatásaink felhasználóitól származó információkat – beleértve azt is, hogyan tilthatja meg ChatGPT-beszélgetéseinek felhasználását modelljeink fejlesztéséhez –, olvassa el Adatvédelmi irányelveinket és ezt a súgóközpontbeli cikket.

Mi a ChatGPT, és hogyan működik?

A ChatGPT egy mesterséges intelligencián alapuló szolgáltatás, amely az interneten vagy egy alkalmazáson keresztül érhető el. A ChatGPT számos feladatra használható, például információk rendszerezésére és összefoglalására, fordítás segítésére, programozásra, kutatásra és elemzésre, több eszközön átívelő, többlépéses feladatok elvégzésére, képek elemzésére vagy létrehozására, a kreativitás és az ötletelés ösztönzésére, illetve más hétköznapi tevékenységekre. A ChatGPT-t úgy terveztük, hogy nagy mennyiségű – többek között szöveges, képi, hang- és videóalapú – információ mintázatait megtanulva értelmezze és megválaszolja a felhasználók kérdéseit, illetve kövesse utasításaikat. 

A betanítás során a modell elemzi az adatokon belüli összefüggéseket – például azt, hogy egy adott szövegkörnyezetben mely szavak fordulnak elő jellemzően együtt –, majd ezt a tudást felhasználva, szóról szóra megjósolja a válasz következő legvalószínűbb szavát. A szöveg kisebb egységekre, úgynevezett „tokenekre” bontható, amelyek teljes szavakat, szórészleteket vagy írásjeleket jelölhetnek. A tokenek a modell által feldolgozott szöveg építőelemei. Hasonlóképpen a más tartalomtípusokat, például képeket létrehozó modellek azt tanulják meg, hogy a betanítási adatokban miként kapcsolódnak egymáshoz a képpontok, illetve a hozzájuk tartozó képaláírásokhoz.

A modell tanulási folyamata (az úgynevezett „betanítás”) során például azt a feladatot kaphatja, hogy egészítse ki a következő mondatot: „Ahelyett, hogy balra fordult volna, ___ fordult.” A betanítás kezdetén a válaszai nagyrészt véletlenszerűek. Ahogy azonban a modell nagy mennyiségű szöveget dolgoz fel és tanul meg, egyre jobban felismeri a mintázatokat, és pontosabban jósolja meg a következő legvalószínűbb szót. Ez a folyamat mondatok millióin ismétlődik, így finomítva a modell megértését és javítva pontosságát.

Mivel egy mondat többféleképpen is ésszerűen kiegészíthető – például: „Ahelyett, hogy balra fordult volna, jobbra fordult”, „megfordult” vagy „visszafordult” –, a modell válaszaiban eleve jelen van a véletlenszerűség. Ezért ugyanaz a kérdés különböző lekérdezések során eltérő válaszokat eredményezhet.

A gépi tanulási modellek nagyszámú, „súlyoknak” vagy „paramétereknek” nevezett számértékből, valamint az ezeket értelmező és használó kódból állnak. Ezek a modellek nem tárolják és nem őrzik meg a betanításukhoz használt adatok másolatait. Ehelyett a modell tanulása során a paraméterek értékei kis mértékben módosulnak, hogy tükrözzék a felismert mintázatokat. A korábbi példában a modell nem a betanítási mondatok tárolásával, hanem belső paramétereinek frissítésével jutott el a véletlenszerű szavak jóslásától a pontosabb előrejelzésekig. A modell nem őrzi meg a betanítás során feldolgozott mondatok, képek vagy hanganyagok másolatait. A ChatGPT nem „másol és illeszt be” a betanítási adataiból. Ez ahhoz hasonlítható, ahogy egy sokat tanult tanár az ötletek közötti összefüggések megértése alapján képes fogalmakat elmagyarázni anélkül, hogy az eredeti anyagokat szó szerint megjegyezné vagy visszaadná. Amikor a modell választ hoz létre egy felhasználói kérésre, a megtanult súlyokat használja fel új tartalom előrejelzéséhez és létrehozásához.

Milyen információkkal tanítjuk be a ChatGPT-t?

A nyilvános internetes tartalmak közül kizárólag az interneten szabadon és nyíltan hozzáférhető információkat használjuk fel. Ide tartozhatnak a nyilvánosan hozzáférhető weboldalak, fórumok, blogok, bejegyzések és más nyilvános online tartalmak. Ha például nyilvánosan elérhető online fórumon vesz részt, vagy nyilvános blogbejegyzést, illetve más bejegyzést tesz közzé, ezt a nyilvános tartalmat felhasználhatjuk modellek betanítására. Ugyanakkor lépéseket teszünk annak érdekében, hogy a betanítás során csökkentsük a személyes adatok kezelését.  Nyilvánosan elérhető internetes tartalmak gyűjtésekor szándékosan nem szerzünk be adatokat olyan forrásokból, amelyekről tudjuk, hogy fizetőfal mögött vagy a dark weben találhatók. Emellett szűrőkkel távolítjuk el azokat az anyagokat, amelyekből nem szeretnénk, hogy modelljeink tanuljanak, például a gyűlöletbeszédet, a felnőtteknek szánt tartalmakat, a személyes adatokat összegyűjtő webhelyeket és a kéretlen tartalmakat. A fennmaradó információkat ezután modelljeink betanítására használjuk. 

A webhelytulajdonosok szabványos webes vezérlők, például a robots.txt használatával szabályozhatják, hogy webhelyük nyilvános tartalma hozzáférhető legyen-e betanítási célokra. Így letilthatják a GPTBotot, amely nyilvános tartalmakat térképezhet fel modelljeink betanításának elősegítésére. Útmutatást nyújtunk a webhelytulajdonosoknak ahhoz, hogyan kezelhetik webhelyeik és tartalmaik kapcsolatát MI-rendszereinkkel. 

Harmadik fél partnereinktől származó információkat is felhasználunk modelljeink betanításához és fejlesztéséhez. Ide tartozhatnak a harmadik felekkel kötött megállapodások alapján hozzáférhető adatkészletek információi, valamint az emberi betanítók és kutatók által rendelkezésre bocsátott vagy létrehozott információk, amennyiben ezt szabályzataink és megállapodásaink lehetővé teszik. Ez segít javítani modelljeink minőségét, biztonságát és teljesítményét. Az adatkészlettől függően ezek a források szöveget, képet, hangot, videót vagy más típusú adatokat tartalmazhatnak.

Egyes betanítási folyamatokban egyre nagyobb mértékben használunk szintetikus adatokat is. Információk és modelljeink felhasználásával például szintetikus utasításokat, többnyelvű példákat vagy más betanítási anyagokat hozhatunk létre. A szintetikus adatok javíthatják a modell teljesítményét, például kiegészíthetik a betanítási adatokat azokon a területeken, ahol kevés vagy kiegyensúlyozatlan adat áll rendelkezésre, továbbá támogathatják a modellek adatvédelmet erősítő fejlesztési módszereit.

Használunk személyes adatokat a ChatGPT betanításához?

Az online tartalmak jelentős része emberekkel kapcsolatos információkat tartalmaz, ezért betanítási adataink között járulékosan személyes adatok is előfordulhatnak. Ugyanakkor lépéseket teszünk annak érdekében, hogy a betanítás során csökkentsük a személyes adatok kezelését.

A betanítási adatokat a modell képességeinek – például előrejelzési, érvelési és problémamegoldó képességének – fejlesztésére használjuk, nem pedig személyek profilozására, kapcsolatfelvételre vagy személyre szabott hirdetések megjelenítésére.

Bizonyos esetekben a modellek személyes adatokból tanulhatják meg, hogyan működnek a nyelvben az olyan elemek, mint a nevek és címek, illetve hogyan ismerhetők fel a közszereplők és a jól ismert szervezetek. Ez segít a modellnek pontosabb és az adott szövegkörnyezethez jobban illő válaszokat létrehozni.

Hogyan védjük a személyes adatokat a betanítás során?

Aktív lépéseket teszünk a személyes adatok kezelésének korlátozására a betanítás során. Kizárjuk például azokat az ismert forrásokat, amelyek nagy mennyiségű személyes adatot gyűjtenek össze, szűréssel csökkentjük a személyes adatok mennyiségét a betanítási folyamatban, továbbá az ismétlődő tartalmak azonosításával és eltávolításával mérsékeljük a betanítási adatok megismétlésének kockázatát. Emellett úgy tanítjuk be modelljeinket, hogy ne válaszoljanak magánszemélyek bizalmas vagy érzékeny adataira irányuló kérésekre. 

Mennyi ideig őrizzük meg az információkat?

A betanítási adatokban szereplő információkat csak addig őrizzük meg, ameddig az e cikkben és Adatvédelmi irányelveinkben ismertetett célokhoz észszerűen szükséges, beleértve modelljeink fejlesztését és javítását, valamint a kapcsolódó tudományos kutatást. A megőrzés szükségességét rendszeresen felülvizsgáljuk; időtartama az információ típusától és felhasználási módjától függ. A megőrzési idő meghatározásakor figyelembe vesszük többek között az adatkezelés célját, az információ mennyiségét, jellegét és érzékenységét, a jogosulatlan felhasználásból vagy nyilvánosságra hozatalból eredő esetleges károk kockázatát, valamint a ránk vonatkozó jogi kötelezettségeket.

Hogyan felel meg a ChatGPT fejlesztése az adatvédelmi jogszabályoknak?

A betanítási információkat jogszerűen használjuk fel. Alapmodelljeink számos hasznos alkalmazás működését biztosítják, többek között akadálymentesítési eszközökét, ügyfélszolgálati megoldásokét, szoftverfejlesztési eszközökét, személyre szabott oktatási alkalmazásokét és tudományos kutatási rendszerekét. Ezek a képességek nagy mennyiségű betanítási adatra támaszkodnak, beleértve a nyilvánosan hozzáférhető információkat és a harmadik fél partnerektől származó információkat. A teljes betanítási folyamat során óvintézkedéseket alkalmazunk, köztük olyan lépéseket, amelyek célja a személyes adatok kezelésének csökkentése és a kockázatok mérséklése az e cikkben ismertetett módon. A betanítási információkban szereplő személyes adatok gyűjtését és felhasználását az adatvédelmi jogszabályok – például a GDPR – szerinti jogos érdekekre alapozzuk. Ezek közé tartozik modelljeink betanítása és fejlesztése a felhasználók és a társadalom egésze érdekében, összhangban azzal a küldetésünkkel, hogy a mesterséges általános intelligencia mindenki javát szolgálja. Erről Adatvédelmi irányelveinkben olvashat részletesebben. Adatvédelmi hatásvizsgálatot végeztünk annak elősegítésére, hogy ezeket az információkat jogszerűen és felelősen gyűjtsük és használjuk fel.

Mikor oszthatjuk meg vagy továbbíthatjuk az információkat?

Nem „értékesítünk” személyes adatokat, és a betanítási adatokban szereplő személyes adatokat kizárólag az Adatvédelmi irányelveinkben ismertetett, korlátozott körülmények között adjuk át. Megoszthatunk például információkat olyan kapcsolt vállalkozásokkal, beszállítókkal és szolgáltatókkal, amelyek támogatják modelljeink fejlesztését, tesztelését és továbbfejlesztését. Információkat akkor is átadhatunk, ha jóhiszeműen úgy véljük, hogy ez jogi kötelezettség teljesítéséhez, illetve saját magunk, felhasználóink, munkavállalóink vagy a nyilvánosság jogainak, testi épségének és biztonságának védelméhez szükséges, az Adatvédelmi irányelveinkben leírtak szerint.

Mivel infrastruktúránk globális, a betanítási adatokban szereplő személyes adatokat az EGT-n, Svájcon vagy az Egyesült Királyságon kívüli országokban – többek között az Egyesült Államokban – is kezelhetjük. Ilyen esetekben megfelelő garanciákat alkalmazunk, például megfelelőségi határozatokat vagy általános szerződési feltételeket, az Adatvédelmi irányelveinkben leírtak szerint.

Az Ön jogai és azok gyakorlása

Válaszolunk a tiltakozásokra és az érintetti jogok gyakorlására irányuló hasonló kérelmekre. A nyelv megtanulásának következtében a ChatGPT válaszai időnként személyes adatokat tartalmazhatnak olyan személyekről, akiknek személyes adatai többször is megjelennek a nyilvános interneten, például közszereplőkről. Bizonyos joghatóságokban a magánszemélyek az Adatvédelmi portálon tiltakozhatnak személyes adataik modelljeink általi kezelése ellen, illetve más, érintetti jogaik gyakorlására irányuló kérelmet nyújthatnak be. E jogait a privacy@openai.com címen is gyakorolhatja.

Kérelme értékelésének és megválaszolásának elősegítéséhez adjon meg elegendő információt ahhoz, hogy megértsük, milyen személyes adatokra vonatkozik. Ilyen lehet például a neve, a kapcsolódó URL-címek, a modellkimenetek konkrét példái vagy a probléma azonosítását segítő más részletek. Bizonyos esetekben az intézkedés előtt kérhetjük személyazonosságának igazolását vagy annak megerősítését, hogy az információ Önre vonatkozik. A kérelmek benyújtásáról – beleértve a bevált módszereket és a kérelmek elbírálásának módját – a személyes adatok ChatGPT-ből való eltávolításáról szóló súgóközpontbeli cikkünkben talál további információt. A kérelmeket a vonatkozó adatvédelmi jogszabályoknak megfelelően vizsgáljuk meg, és az alkalmazandó törvényi határidőkön belül válaszolunk rájuk.

Felhívjuk figyelmét, hogy az adatvédelmi jogszabályok értelmében egyes jogok nem feltétlenül korlátlanok. Előfordulhat például, hogy nem tudunk teljesíteni egy kérelmet, ha nem tudjuk ellenőrizni az érintett információkat, ha a kérelem nem az OpenAI által kezelt személyes adatokra vonatkozik, ha kivétel alkalmazandó, vagy ha más jogszerű indokunk van erre. A kérelmeket egyedileg értékeljük, és ennek során mérlegelhetjük az adatvédelmi jogokat más fontos szempontokkal, például a véleménynyilvánítás szabadságával és a közérdekkel szemben.

Mindazonáltal arra törekszünk, hogy elsőbbséget adjunk a személyes adatok védelmének, és megfeleljünk minden alkalmazandó adatvédelmi jogszabálynak. Ha úgy véli, hogy nem kezeltük megfelelően a problémát, jogában áll panaszt tenni a helyi felügyeleti hatóságnál.

Ha többet szeretne megtudni arról, hogyan kezeli az OpenAI azokat a személyes adatokat, amelyeket webhelyünk, alkalmazásaink és szolgáltatásaink használatakor Öntől vagy Önről gyűjtünk, olvassa el Adatvédelmi irányelveinket.

Hasznos volt ez a cikk?