OpenAI
Táto stránka bola strojovo preložená. Prečítaj si pôvodný článok v angličtine.

Ako sa vyvíja ChatGPT a naše základné modely

Zistite viac o tom, ako vyvíjame naše modely a používame ich v produktoch, ako je ChatGPT

Aktualizované: 2 days ago

Základné modely OpenAI vrátane modelov, na ktorých funguje ChatGPT, sa vyvíjajú pomocou troch hlavných zdrojov informácií: (1) verejne dostupných informácií na internete, (2) informácií, ku ktorým získavame prístup v spolupráci s tretími stranami, a (3) informácií, ktoré poskytujú alebo vytvárajú naši používatelia, školitelia a výskumníci.

Vývoj základných modelov, aké sa používajú v službe ChatGPT, zahŕňa niekoľko etáp vrátane prípravy trénovacích údajov, predbežného trénovania a následného trénovania, ako aj priebežného hodnotenia a zlepšovania po nasadení. V týchto etapách sa môžu na rôzne účely používať rozličné typy informácií, napríklad na zlepšenie výkonu, spoľahlivosti a bezpečnosti modelov. 

Tento článok prináša prehľad informácií, ktoré používame pri vývoji týchto modelov, spôsobu, akým ich zhromažďujeme a používame v súlade s právnymi predpismi o ochrane súkromia, a ochranných opatrení, ktoré uplatňujeme počas celého procesu trénovania. Informácie o tom, ako zhromažďujeme a používame údaje od používateľov našich služieb vrátane možnosti odmietnuť používanie konverzácií v službe ChatGPT na zlepšovanie našich modelov, nájdete v našich zásadách ochrany osobných údajov a v tomto článku Centra pomoci.

Čo je ChatGPT a ako funguje?

ChatGPT je služba založená na umelej inteligencii, ku ktorej môžete pristupovať cez internet alebo aplikáciu. ChatGPT môžete používať na širokú škálu úloh vrátane usporiadania a sumarizácie informácií, pomoci s prekladmi, programovaním, výskumom a analýzou, plnenia viackrokových úloh v rôznych nástrojoch, analýzy či vytvárania obrázkov, rozvíjania kreativity a nápadov aj ďalších každodenných činností. ChatGPT je navrhnutý tak, aby rozumel otázkam a pokynom používateľov a odpovedal na ne vďaka vzorom, ktoré sa naučil z veľkého množstva informácií vrátane textu, obrázkov, zvuku a videa. 

Počas trénovania model analyzuje vzťahy v týchto údajoch, napríklad ako sa slová zvyčajne spoločne vyskytujú v určitom kontexte, a pomocou tohto poznania pri vytváraní odpovede postupne predpovedá vždy ďalšie najpravdepodobnejšie slovo. Text možno previesť na menšie jednotky, niekedy nazývané „tokeny“, ktoré môžu predstavovať celé slová, časti slov alebo interpunkčné znamienka. Tokeny sú základné stavebné prvky textu, ktoré model spracúva. Podobne sa modely, ktoré vytvárajú iné formy obsahu, napríklad obrázky, učia vzory vo vzájomných vzťahoch medzi pixelmi a v ich vzťahoch k priradeným popisom v trénovacích údajoch.

Počas procesu učenia modelu (známeho ako „trénovanie“) môže model napríklad dostať za úlohu doplniť vetu: „Namiesto toho, aby odbočila doľava, odbočila ___.“ V úvodných fázach trénovania sú jeho odpovede prevažne náhodné. Keď však model spracúva veľké množstvo textu a učí sa z neho, postupne dokáže lepšie rozpoznávať vzory a predpovedať najpravdepodobnejšie nasledujúce slovo. Tento proces sa opakuje pri miliónoch viet, aby model prehĺbil svoje porozumenie a zvýšil svoju presnosť.

Keďže vetu možno vierohodne dokončiť viacerými spôsobmi, napríklad „Namiesto toho, aby odbočila doľava, odbočila doprava“, „otočila sa“ alebo „vrátila sa“, odpovede modelu prirodzene obsahujú určitú mieru náhodnosti. Tá istá otázka preto môže pri jednotlivých zadaniach priniesť rôzne odpovede.

Modely strojového učenia pozostávajú z veľkých súborov čísel označovaných ako „váhy“ alebo „parametre“ a z kódu, ktorý tieto čísla interpretuje a používa. Tieto modely neukladajú ani neuchovávajú kópie údajov, na ktorých sa trénujú. Pri učení modelu sa namiesto toho mierne upravujú hodnoty jeho parametrov, aby odrážali vzory, ktoré rozpoznal. V predchádzajúcom príklade sa model zlepšil od predpovedania náhodných slov k presnejším predpovediam nie tým, že by si ukladal trénovacie vety, ale aktualizáciou svojich vnútorných parametrov. Model neuchováva kópie viet, obrázkov ani zvukových záznamov, ktoré spracúva počas trénovania. ChatGPT „nekopíruje a nevkladá“ obsah zo svojich trénovacích údajov. Podobne ako učiteľ po dôkladnom štúdiu dokáže vysvetľovať pojmy na základe porozumenia vzťahom medzi myšlienkami bez toho, aby si pôvodné materiály zapamätal alebo ich doslovne reprodukoval. Pri vytváraní odpovede na požiadavku používateľa model využíva tieto naučené váhy na predpovedanie a tvorbu nového obsahu.

Aké informácie sa používajú na učenie služby ChatGPT?

Z verejne dostupného internetového obsahu používame iba informácie, ktoré sú na internete voľne a otvorene prístupné. Môže ísť o verejne dostupné webové stránky, verejné fóra, verejné blogy a príspevky či iný verejne dostupný online obsah. Ak sa napríklad zapojíte do verejne dostupného internetového diskusného fóra alebo uverejníte verejný blog či iný príspevok, môžeme tento verejne prístupný obsah použiť na trénovanie modelov. Prijímame však opatrenia na obmedzenie spracúvania osobných údajov počas trénovania.  Pri zhromažďovaní verejne dostupného internetového obsahu zámerne nezískavame údaje zo zdrojov, o ktorých vieme, že sú za platobnou bránou, ani z dark webu. Používame tiež filtre na odstránenie materiálov, z ktorých nechceme naše modely učiť, napríklad nenávistných prejavov, obsahu pre dospelých, webov zhromažďujúcich osobné údaje a spamu. Zvyšné informácie sa následne používajú na trénovanie našich modelov. 

Vlastníci webov môžu pomocou štandardných webových ovládacích prvkov, ako je súbor robots.txt, rozhodovať, či sa má k verejne dostupnému obsahu z ich webov pristupovať na účely trénovania. V súbore môžu zakázať prístup robotu GPTBot, ktorý môže prehľadávať verejne dostupný obsah, aby pomohol trénovať naše modely. Vlastníkom webov poskytujeme pokyny, ktoré im pomáhajú spravovať interakciu ich webov a obsahu s našimi systémami umelej inteligencie. 

Na trénovanie a zlepšovanie našich modelov používame aj informácie od partnerov z radov tretích strán. Môže ísť o informácie v súboroch údajov, ku ktorým pristupujeme na základe dohôd s tretími stranami, ako aj o informácie poskytnuté alebo vytvorené školiteľmi a výskumníkmi, ak to povoľujú naše pravidlá a dohody. Pomáha to zlepšovať kvalitu, bezpečnosť a výkon našich modelov. V závislosti od súboru údajov môžu tieto zdroje zahŕňať text, obrázky, zvuk, video alebo iné typy údajov.

V niektorých procesoch trénovania čoraz častejšie používame aj syntetické údaje. Informácie a naše modely môžeme napríklad používať na vytváranie syntetických zadaní, viacjazyčných príkladov alebo iných trénovacích materiálov. Syntetické údaje môžu zlepšiť výkon modelov, napríklad doplnením trénovacích údajov v oblastiach, kde ich je málo alebo sú nevyvážené, a môžu podporiť aj postupy vývoja modelov zvyšujúce ochranu súkromia.

Používajú sa osobné údaje na učenie služby ChatGPT?

Významná časť online obsahu obsahuje informácie o ľuďoch, takže sa v našich trénovacích údajoch môžu náhodne vyskytnúť aj osobné údaje. Prijímame však opatrenia na obmedzenie spracúvania osobných údajov počas trénovania.

Trénovacie údaje používame na rozvoj schopností modelu, ako sú predpovedanie, uvažovanie a riešenie problémov, nie na vytváranie profilov jednotlivcov, kontaktovanie ľudí ani prispôsobovanie reklám konkrétnym osobám.

V niektorých prípadoch sa modely môžu z osobných údajov učiť, ako v jazyku fungujú prvky, ako sú mená a adresy, alebo ako rozpoznávať verejne známe osoby a všeobecne známe subjekty. Model tak môže vytvárať presnejšie odpovede, ktoré lepšie zodpovedajú kontextu.

Ako sú osobné údaje chránené počas trénovania?

Aktívne podnikáme kroky na obmedzenie spracúvania osobných údajov počas trénovania. Vylučujeme napríklad známe zdroje, ktoré zhromažďujú veľké množstvo osobných údajov, používame filtre na obmedzenie osobných údajov v procese trénovania a podnikáme kroky na rozpoznanie a odstránenie duplicitného obsahu, aby sme znížili riziko opakovania trénovacích údajov. Naše modely navyše trénujeme tak, aby neodpovedali na žiadosti o súkromné alebo citlivé informácie o jednotlivcoch. 

Ako dlho uchovávame informácie

Informácie v trénovacích údajoch uchovávame iba tak dlho, ako je primerane potrebné na účely opísané v tomto článku a v našich zásadách ochrany osobných údajov, a to aj na vývoj a zlepšovanie našich modelov a na súvisiace účely vedeckého výskumu. Uchovávanie pravidelne preverujeme, aby sme sa uistili, že je naďalej potrebné. Jeho dĺžka závisí od typu informácií a spôsobu ich použitia. Pri určovaní doby uchovávania zohľadňujeme faktory, ako sú účel spracúvania informácií, ich množstvo, povaha a citlivosť, potenciálne riziko ujmy v dôsledku neoprávneného použitia alebo zverejnenia a všetky právne povinnosti, ktoré sa na nás vzťahujú.

Ako vývoj služby ChatGPT spĺňa právne predpisy o ochrane súkromia?

Informácie na trénovanie používame zákonným spôsobom. Naše základné modely využíva široká škála užitočných aplikácií vrátane nástrojov na zlepšenie prístupnosti, zákazníckej podpory, vývoja softvéru, personalizovaného vzdelávania a vedeckého výskumu. Tieto schopnosti závisia od rozsiahlych trénovacích údajov vrátane verejne dostupných informácií a informácií od partnerov z radov tretích strán. Počas celého procesu trénovania uplatňujeme ochranné opatrenia vrátane krokov určených na obmedzenie spracúvania osobných údajov a zmiernenie rizík, ako sa opisuje v tomto článku. Zhromažďovanie a používanie osobných údajov zahrnutých v informáciách na trénovanie zakladáme na oprávnených záujmoch podľa právnych predpisov o ochrane súkromia, ako je GDPR. Patrí sem trénovanie a zlepšovanie našich modelov pre používateľov aj širšiu spoločnosť v súlade s naším poslaním zabezpečiť, aby všeobecná umelá inteligencia prinášala úžitok všetkým. Podrobnejšie to vysvetľujeme v našich zásadách ochrany osobných údajov. Vypracovali sme posúdenie vplyvu na ochranu údajov, ktoré nám pomáha zabezpečiť, aby sme tieto informácie zhromažďovali a používali zákonne a zodpovedne.

Kedy možno informácie zdieľať alebo prenášať

Osobné údaje „nepredávame“ a osobné údaje v trénovacích údajoch sprístupňujeme iba v obmedzených prípadoch opísaných v našich zásadách ochrany osobných údajov. Informácie môžeme napríklad zdieľať s pridruženými spoločnosťami, dodávateľmi a poskytovateľmi služieb, ktorí podporujú vývoj, testovanie a zlepšovanie našich modelov. Informácie môžeme sprístupniť aj v dobrej viere, že je to nevyhnutné na splnenie zákonnej povinnosti alebo ochranu našich práv a našej bezpečnosti, ako aj práv a bezpečnosti našich používateľov, zamestnancov či verejnosti, ako sa uvádza v našich zásadách ochrany osobných údajov.

Keďže naša infraštruktúra je globálna, osobné údaje v trénovacích údajoch sa môžu spracúvať v krajinách mimo EHP, Švajčiarska alebo Spojeného kráľovstva (vrátane Spojených štátov). V takom prípade uplatňujeme primerané ochranné opatrenia, ako sú rozhodnutia o primeranosti alebo štandardné zmluvné doložky, ktoré opisujeme v našich zásadách ochrany osobných údajov.

Vaše práva a spôsob ich uplatnenia

Reagujeme na námietky proti spracúvaniu aj na podobné žiadosti o uplatnenie práv. Keďže sa ChatGPT učí jazyk, jeho odpovede môžu niekedy obsahovať osobné údaje o ľuďoch, ktorých osobné údaje sa viackrát objavujú na verejne prístupnom internete (napríklad o verejne známych osobách). Jednotlivci v niektorých jurisdikciách môžu prostredníctvom nášho Portálu ochrany súkromia namietať proti spracúvaniu svojich osobných údajov našimi modelmi alebo podať inú žiadosť o uplatnenie práv dotknutej osoby. Tieto práva si môžete uplatniť aj kontaktovaním adresy privacy@openai.com.

Aby sme mohli vašu žiadosť posúdiť a odpovedať na ňu, poskytnite nám dostatok informácií na pochopenie, ktorých osobných údajov sa týka. Môže ísť napríklad o vaše meno, príslušné adresy URL, konkrétne príklady výstupov modelu alebo iné podrobnosti, ktoré nám pomôžu problém identifikovať. V niektorých prípadoch vás môžeme pred prijatím opatrení požiadať o overenie totožnosti alebo potvrdenie, že sa dané informácie týkajú vás. Ďalšie informácie o podávaní týchto žiadostí vrátane odporúčaných postupov a spôsobu ich posudzovania nájdete v našom článku Centra pomoci o odstránení osobných údajov zo služby ChatGPT. Žiadosti posudzujeme v súlade s príslušnými právnymi predpismi o ochrane súkromia a odpovedáme v platných zákonných lehotách.

Upozorňujeme, že niektoré práva nemusia byť podľa právnych predpisov o ochrane súkromia absolútne. Žiadosti napríklad nemusíme vedieť vyhovieť, ak nemožno overiť príslušné informácie, ak sa žiadosť netýka osobných údajov spracúvaných spoločnosťou OpenAI, ak sa uplatňuje výnimka alebo ak na to máme iný zákonný dôvod. Žiadosti posudzujeme individuálne, pričom môže byť potrebné vyvážiť práva na ochranu súkromia s inými dôležitými záujmami, ako sú sloboda prejavu a verejný záujem.

Usilujeme sa však uprednostňovať ochranu osobných údajov a dodržiavať všetky platné právne predpisy o ochrane súkromia. Ak sa domnievate, že sme problém nevyriešili primerane, máte právo podať sťažnosť miestnemu dozornému orgánu.

Ďalšie informácie o postupoch spoločnosti OpenAI týkajúcich sa osobných údajov, ktoré zhromažďujeme od vás alebo o vás pri používaní našich webových stránok, aplikácií a služieb, nájdete v našich zásadách ochrany osobných údajov.

Bol tento článok užitočný?