Základní modely OpenAI, včetně modelů, na kterých funguje ChatGPT, jsou vyvíjeny s využitím tří hlavních zdrojů informací: (1) informací veřejně dostupných na internetu, (2) informací, k nimž získáváme přístup ve spolupráci s třetími stranami, a (3) informací, které poskytují nebo vytvářejí naši uživatelé, lidští školitelé a výzkumní pracovníci.
Vývoj základních modelů, jako jsou ty používané v ChatGPT, zahrnuje několik fází včetně přípravy tréninkových dat, předtrénování a následného tréninku, ale také průběžného hodnocení a zlepšování po nasazení. V těchto fázích lze používat různé typy informací k různým účelům, například ke zlepšování výkonu, spolehlivosti a bezpečnosti modelu.
Tento článek přináší přehled informací, které používáme při vývoji těchto modelů, způsobů, jakými je shromažďujeme a používáme v souladu s právními předpisy na ochranu soukromí, a ochranných opatření uplatňovaných v celém procesu tréninku. Informace o tom, jak shromažďujeme a používáme údaje od uživatelů našich služeb, včetně možnosti odmítnout použití konverzací v ChatGPT ke zlepšování našich modelů, najdete v našich Zásadách ochrany soukromí a v tomto článku Centra nápovědy.
Co je ChatGPT a jak funguje?
ChatGPT je služba založená na umělé inteligenci, ke které můžete přistupovat přes internet nebo aplikaci. ChatGPT můžete používat k celé řadě úkolů, například k uspořádání a shrnutí informací, překladům, programování, výzkumu a analýze, plnění vícekrokových úkolů napříč různými nástroji, analýze či generování obrázků, podpoře kreativity a nových nápadů i k dalším každodenním činnostem. ChatGPT je navržen tak, aby rozuměl otázkám a pokynům uživatelů a odpovídal na ně díky rozpoznávání vzorců ve velkém množství informací, včetně textu, obrázků, zvuku a videa.
Během tréninku model analyzuje vztahy v těchto datech, například jak se slova obvykle společně vyskytují v určitém kontextu, a na základě tohoto porozumění při vytváření odpovědi postupně předpovídá další nejpravděpodobnější slovo. Text lze převést na menší jednotky, někdy označované jako „tokeny“, které mohou představovat celá slova, části slov nebo interpunkční znaménka. Tokeny jsou základní stavební jednotky textu, který model zpracovává. Podobně se modely vytvářející jiné formy obsahu, například obrázky, učí rozpoznávat vzorce ve vzájemných vztazích mezi pixely a mezi pixely a souvisejícími popisky v tréninkových datech.
Například během procesu učení modelu (označovaného jako „trénink“) může model dostat za úkol doplnit větu: „Místo aby odbočila doleva, odbočila ___.“ V počátečních fázích tréninku jsou jeho odpovědi převážně náhodné. Jak však model zpracovává velké množství textu a učí se z něj, postupně se zlepšuje v rozpoznávání vzorců a předpovídání nejpravděpodobnějšího následujícího slova. Tento proces se opakuje u milionů vět, aby se zpřesnilo porozumění modelu a zvýšila jeho přesnost.
Protože větu lze věrohodně dokončit několika způsoby – například „Místo aby odbočila doleva, odbočila doprava“, „otočila se“ nebo „vrátila se“ –, obsahují odpovědi modelu nevyhnutelný prvek náhodnosti. Stejná otázka proto může při různých dotazech vést k různým odpovědím.
Modely strojového učení se skládají z rozsáhlých souborů čísel označovaných jako „váhy“ nebo „parametry“ a z kódu, který tato čísla interpretuje a používá. Tyto modely neukládají ani neuchovávají kopie dat, na kterých byly trénovány. Při učení modelu se místo toho mírně upravují hodnoty jeho parametrů, aby odrážely rozpoznané vzorce. V předchozím příkladu se model zlepšil od předpovídání náhodných slov k přesnějším předpovědím nikoli ukládáním tréninkových vět, ale aktualizací svých interních parametrů. Model neuchovává kopie vět, obrázků ani zvukových záznamů, které zpracovává během tréninku. ChatGPT svá tréninková data „nekopíruje a nevkládá“. Podobně jako učitel, který po důkladném studiu dokáže vysvětlovat pojmy díky pochopení vztahů mezi myšlenkami, aniž by si původní materiály pamatoval nebo je doslovně reprodukoval. Při vytváření odpovědi na požadavek uživatele model používá tyto naučené váhy k předpovídání a tvorbě nového obsahu.
Jaké informace se používají k učení ChatGPT?
Z veřejně dostupného internetového obsahu používáme pouze informace, které jsou na internetu volně a otevřeně přístupné. Může jít o veřejně dostupné webové stránky, veřejná fóra, veřejné blogy a příspěvky i další veřejně dostupný obsah na internetu. Pokud se například zapojíte do veřejně dostupného internetového diskusního fóra nebo zveřejníte blog či jiný příspěvek, můžeme tento veřejně přístupný obsah použít k tréninku modelu. Podnikáme však kroky k omezení zpracování osobních údajů během tréninku. Při shromažďování veřejně dostupného internetového obsahu záměrně nezískáváme data ze zdrojů, o kterých víme, že jsou za platební bránou, ani z dark webu. Pomocí filtrů navíc odstraňujeme materiály, ze kterých se naše modely nemají učit, například nenávistné projevy, obsah pro dospělé, weby shromažďující osobní údaje a spam. Zbývající informace se následně používají k tréninku našich modelů.
Vlastníci webů mohou pomocí standardních webových mechanismů, například souboru robots.txt, určit, zda smí být veřejně dostupný obsah z jejich webů použit k tréninku. Mohou tak zakázat přístup robotu GPTBot, který může procházet veřejně dostupný obsah a pomáhat tak s tréninkem našich modelů. Vlastníkům webů poskytujeme pokyny, které jim pomáhají řídit interakci jejich webů a obsahu s našimi systémy umělé inteligence.
K tréninku a zlepšování našich modelů používáme také informace od partnerů z řad třetích stran. Může jít o informace v datových sadách, ke kterým přistupujeme na základě dohod s třetími stranami, a také o informace poskytnuté nebo vytvořené lidskými školiteli a výzkumnými pracovníky, pokud to dovolují naše zásady a dohody. To pomáhá zlepšovat kvalitu, bezpečnost a výkon našich modelů. V závislosti na konkrétní datové sadě mohou tyto zdroje obsahovat text, obrázky, zvuk, video nebo jiné typy dat.
V některých procesech tréninku také stále více využíváme syntetická data. Informace a naše modely můžeme například používat k vytváření syntetických promptů, vícejazyčných příkladů nebo jiných tréninkových materiálů. Syntetická data mohou pomoci zlepšovat výkon modelu, mimo jiné doplněním tréninkových dat v oblastech, kde jich je nedostatek nebo jsou nevyvážená. Mohou také podpořit přístupy k vývoji modelů, které posilují ochranu soukromí.
Používají se k učení ChatGPT osobní údaje?
Významná část internetového obsahu zahrnuje informace o lidech, takže naše tréninková data mohou osobní údaje obsahovat i náhodně. Podnikáme však kroky k omezení zpracování osobních údajů během tréninku.
Tréninková data používáme k rozvoji schopností modelu, jako je předpovídání, uvažování a řešení problémů, nikoli k vytváření profilů jednotlivců, jejich kontaktování nebo personalizaci reklam pro ně.
V některých případech se modely mohou učit z osobních údajů, aby pochopily, jak v jazyce fungují prvky jako jména a adresy, nebo aby rozpoznaly veřejně známé osoby a subjekty. To modelu pomáhá vytvářet přesnější a kontextově vhodnější odpovědi.
Jak jsou osobní údaje během tréninku chráněny?
Aktivně podnikáme kroky k omezení zpracování osobních údajů během tréninku. Vylučujeme například známé zdroje shromažďující velké množství osobních údajů, pomocí filtrů omezujeme osobní údaje v procesu tréninku a vyhledáváme a odstraňujeme duplicitní obsah, abychom snížili riziko opakování tréninkových dat. Naše modely navíc trénujeme tak, aby neodpovídaly na žádosti o soukromé nebo citlivé údaje o jednotlivcích.
Jak dlouho informace uchováváme
Informace v tréninkových datech uchováváme pouze po dobu přiměřeně nezbytnou pro účely popsané v tomto článku a v našich Zásadách ochrany soukromí, včetně vývoje a zlepšování našich modelů a souvisejícího vědeckého výzkumu. Dobu uchovávání pravidelně přezkoumáváme, abychom ověřili, zda je uchovávání nadále nezbytné. Liší se podle typu informací a způsobu jejich použití. Při určování doby uchovávání zohledňujeme například účel zpracování informací, jejich množství, povahu a citlivost, možné riziko újmy v důsledku neoprávněného použití či zveřejnění a veškeré právní povinnosti, které se na nás vztahují.
Jak vývoj ChatGPT dodržuje právní předpisy na ochranu soukromí?
Informace k tréninku používáme v souladu se zákonem. Naše základní modely umožňují provozovat širokou škálu užitečných aplikací, včetně nástrojů pro usnadnění přístupu, zákaznické podpory, vývoje softwaru, personalizovaného vzdělávání a vědeckého výzkumu. Tyto schopnosti závisejí na rozsáhlých tréninkových datech, včetně veřejně dostupných informací a informací od partnerů z řad třetích stran. V celém procesu tréninku uplatňujeme ochranná opatření, včetně kroků určených k omezení zpracování osobních údajů a zmírnění rizik, jak je popsáno v tomto článku. Shromažďování a používání osobních údajů obsažených v informacích k tréninku zakládáme na oprávněných zájmech podle právních předpisů na ochranu soukromí, jako je GDPR. Patří sem trénink a zlepšování našich modelů ve prospěch uživatelů i širší společnosti v souladu s naším posláním zajistit, aby obecná umělá inteligence přinášela prospěch všem. Podrobnější informace najdete v našich Zásadách ochrany soukromí. Dokončili jsme posouzení vlivu na ochranu osobních údajů, které nám pomáhá zajistit, že tyto informace shromažďujeme a používáme zákonně a odpovědně.
Kdy mohou být informace sdíleny nebo předávány
Osobní údaje „neprodáváme“ a osobní údaje v tréninkových datech zpřístupňujeme pouze v omezených případech popsaných v našich Zásadách ochrany soukromí. Informace můžeme například sdílet s přidruženými společnostmi, dodavateli a poskytovateli služeb, kteří podporují vývoj, testování a zlepšování našich modelů. Informace můžeme také zpřístupnit, pokud se v dobré víře domníváme, že je to nezbytné ke splnění právní povinnosti nebo k ochraně našich práv a bezpečnosti či práv a bezpečnosti našich uživatelů, zaměstnanců nebo veřejnosti, jak je popsáno v našich Zásadách ochrany soukromí.
Protože je naše infrastruktura globální, mohou být osobní údaje v tréninkových datech zpracovávány v zemích mimo EHP, Švýcarsko nebo Spojené království, včetně Spojených států. V takových případech uplatňujeme vhodná ochranná opatření, například rozhodnutí o odpovídající ochraně nebo standardní smluvní doložky, jak je popsáno v našich Zásadách ochrany soukromí.
Vaše práva a způsob jejich uplatnění
Reagujeme na námitky proti zpracování i podobné žádosti o uplatnění práv. V důsledku učení jazyka mohou odpovědi ChatGPT někdy obsahovat osobní údaje o jednotlivcích, jejichž osobní údaje se na veřejném internetu objevují opakovaně, například o veřejně známých osobách. Jednotlivci v některých jurisdikcích mohou prostřednictvím našeho Portálu ochrany osobních údajů vznést námitku proti zpracování svých osobních údajů našimi modely nebo podat jiné žádosti o uplatnění práv subjektu údajů. Tato práva můžete uplatnit také na adrese privacy@openai.com.
Abychom mohli vaši žádost posoudit a odpovědět na ni, uveďte dostatek informací, abychom pochopili, kterých osobních údajů se týká. Může jít například o vaše jméno, příslušné adresy URL, konkrétní příklady výstupů modelu nebo jiné podrobnosti, které pomohou problém identifikovat. V některých případech vás před provedením dalších kroků můžeme požádat o ověření totožnosti nebo potvrzení, že se informace týkají vás. Další informace o podávání těchto žádostí, včetně doporučených postupů a způsobu jejich posuzování, najdete v našem článku Centra nápovědy o odstranění osobních údajů z ChatGPT. Žádosti posuzujeme v souladu s platnými právními předpisy na ochranu soukromí a odpovídáme ve lhůtách stanovených zákonem.
Upozorňujeme, že některá práva nemusí být podle právních předpisů na ochranu soukromí absolutní. Žádosti například nemusíme být schopni vyhovět, pokud nelze příslušné informace ověřit, žádost se netýká osobních údajů zpracovávaných společností OpenAI, uplatní se výjimka nebo máme jiný zákonný důvod žádosti nevyhovět. Žádosti posuzujeme jednotlivě a můžeme při tom poměřovat práva na ochranu soukromí s dalšími důležitými hledisky, jako je svoboda projevu a veřejný zájem.
Snažíme se však ochranu osobních údajů upřednostňovat a dodržovat všechny platné právní předpisy na ochranu soukromí. Pokud se domníváte, že jsme určitý problém dostatečně nevyřešili, máte právo podat stížnost u místního dozorového úřadu.
Další informace o postupech OpenAI týkajících se osobních údajů, které od vás nebo o vás shromažďujeme při používání našich webových stránek, aplikací a služeb, najdete v našich Zásadách ochrany soukromí.
