Базовите модели на OpenAI, включително моделите, на които работи ChatGPT, се разработват чрез три основни източника на информация: (1) публично достъпна в интернет информация, (2) информация, до която получаваме достъп в партньорство с трети страни, и (3) информация, предоставена или генерирана от нашите потребители, обучители и изследователи.
Разработването на базови модели като използваните в ChatGPT преминава през няколко етапа, сред които подготовка на данните за обучение, предварително обучение и последващо обучение, както и непрекъснато оценяване и подобряване след внедряването. На тези етапи може да се използват различни видове информация за разнообразни цели, включително за подобряване на ефективността, надеждността и безопасността на моделите.
Тази статия представя общ преглед на информацията, която използваме при разработването на тези модели, начина, по който я събираме и използваме в съответствие със законите за поверителност, и защитните мерки, които прилагаме през целия процес на обучение. За да разберете как събираме и използваме информация от потребителите на услугите ни, включително как да откажете разговорите ви в ChatGPT да се използват за подобряване на нашите модели, вижте нашата Политика за поверителност и тази статия в Помощния център.
Какво представлява ChatGPT и как работи?
ChatGPT е услуга, базирана на изкуствен интелект, до която имате достъп през интернет или чрез приложение. Можете да използвате ChatGPT за широк спектър от задачи, включително организиране и обобщаване на информация, съдействие при превод, програмиране, проучвания и анализи, изпълнение на многоетапни задачи с различни инструменти, анализиране или генериране на изображения, вдъхновение за творчество и идеи и други всекидневни дейности. ChatGPT е проектиран да разбира и да отговаря на въпросите и инструкциите на потребителите, като изучава закономерности в големи количества информация, включително текст, изображения, аудио и видео.
По време на обучението моделът анализира връзките в тези данни — например как думите обикновено се срещат заедно в даден контекст — и използва наученото, за да предвижда дума по дума коя е най-вероятната следваща дума при генериране на отговор. Текстът може да бъде преобразуван в по-малки единици, понякога наричани „токени“, които могат да представляват цели думи, части от думи или пунктуационни знаци. Токените са градивните елементи на текста, който моделът обработва. По подобен начин моделите, които генерират други видове съдържание, например изображения, изучават закономерностите във връзките между пикселите и между тях и съответните описания в данните за обучение.
Например по време на процеса на учене на модела (известен като „обучение“) може да му бъде възложено да довърши изречение като: „Вместо да завие наляво, тя зави ___.“ В началото на обучението отговорите му са до голяма степен случайни. Когато обаче моделът обработи и усвои голям обем текст, той започва по-добре да разпознава закономерностите и да предвижда най-вероятната следваща дума. Този процес се повтаря с милиони изречения, за да се усъвършенства разбирането на модела и да се повиши точността му.
Тъй като едно изречение може да бъде довършено по няколко правдоподобни начина — например „Вместо да завие наляво, тя зави надясно“, „обратно“ или „назад“ — отговорите на модела неизбежно съдържат елемент на случайност. Поради това един и същ въпрос може да получи различни отговори при отделни запитвания.
Моделите за машинно обучение се състоят от големи набори от числа, известни като „тегла“ или „параметри“, както и от код, който интерпретира и използва тези числа. Тези модели не съхраняват и не запазват копия на данните, с които са обучени. Вместо това, докато моделът се учи, стойностите на параметрите му се коригират леко, за да отразят установените от него закономерности. В предходния пример моделът премина от предвиждане на случайни думи към по-точни прогнози не чрез съхраняване на изреченията за обучение, а чрез актуализиране на вътрешните си параметри. Моделът не запазва копия на изреченията, изображенията или аудиоматериалите, които обработва по време на обучението. ChatGPT не „копира и поставя“ от данните си за обучение — подобно на учител, който след задълбочено изучаване може да обяснява понятия, като разбира връзките между идеите, без да запаметява или възпроизвежда дословно първоначалните материали. Когато генерира отговор на потребителска заявка, моделът използва тези усвоени тегла, за да предвиди и създаде ново съдържание.
Какъв вид информация се използва за обучението на ChatGPT?
От публичното интернет съдържание използваме само информация, която е свободно и открито достъпна в интернет. Това може да включва публично достъпни уеб страници, форуми, блогове, публикации и друго публично достъпно онлайн съдържание. Например, ако участвате в публично достъпен онлайн форум или публикувате общодостъпен блог или друга публикация, може да използваме това публично съдържание за обучение на моделите. Въпреки това предприемаме мерки за ограничаване на обработването на лична информация в процеса на обучение. Когато събираме публично достъпно интернет съдържание, не извличаме умишлено данни от източници, за които е известно, че са зад платена стена, нито от тъмната мрежа. Освен това прилагаме филтри за премахване на материали, от които не искаме моделите ни да се учат, като реч на омразата, съдържание за възрастни, сайтове, обобщаващи лична информация, и спам. След това останалата информация се използва за обучение на нашите модели.
Собствениците на уебсайтове могат да управляват дали публично достъпното съдържание от сайтовете им да се използва за обучение чрез стандартни уеб контроли, като например забрана за GPTBot в robots.txt. GPTBot може да обхожда публично съдържание, за да подпомага обучението на нашите модели. Предоставяме указания, които помагат на собствениците на уебсайтове да управляват взаимодействието на сайтовете и съдържанието им с нашите системи с изкуствен интелект.
Използваме и информация от партньори — трети страни, за да обучаваме и подобряваме нашите модели. Това може да включва информация от набори от данни, до които имаме достъп по силата на споразумения с трети страни, както и информация, предоставена или генерирана от обучители и изследователи, когато това е разрешено от нашите правила и споразумения. Това помага да подобрим качеството, безопасността и ефективността на нашите модели. В зависимост от набора от данни тези източници може да включват текст, изображения, аудио, видео или други видове данни.
В някои процеси на обучение използваме и все повече синтетични данни. Например може да използваме информация и нашите модели, за да генерираме синтетични подкани, многоезични примери или други материали за обучение. Синтетичните данни могат да подобрят ефективността на моделите, включително като допълват данните за обучение в области, където те са оскъдни или небалансирани, и могат да подпомогнат подходи за разработване на модели с по-добра защита на поверителността.
Използва ли се лична информация за обучението на ChatGPT?
Значителна част от онлайн съдържанието включва информация за хора, затова данните ни за обучение може непреднамерено да съдържат лична информация. Въпреки това предприемаме мерки за ограничаване на обработването на лична информация в процеса на обучение.
Използваме данните за обучение, за да развиваме способностите на модела — като прогнозиране, структурирано анализиране и решаване на проблеми — а не за да създаваме профили на хора, да се свързваме с тях или да им показваме персонализирани реклами.
В някои случаи моделите може да се учат от лична информация, за да разберат как елементи като имена и адреси функционират в езика или да разпознават публични личности и широко известни организации и обекти. Това помага на модела да генерира по-точни и подходящи за контекста отговори.
Как се защитава личната информация по време на обучението?
Предприемаме активни мерки за ограничаване на обработването на лична информация по време на обучението. Например изключваме известни източници, които обобщават големи количества лични данни, прилагаме филтри за ограничаване на личната информация в процеса на обучение и предприемаме мерки за откриване и премахване на дублирано съдържание, за да намалим риска от повтаряне на данни за обучение. Освен това обучаваме моделите си да не отговарят на искания за частна или чувствителна информация за отделни лица.
Колко дълго съхраняваме информацията
Съхраняваме информация в данните за обучение само докато това е разумно необходимо за целите, описани в тази статия и нашата Политика за поверителност, включително за разработване и подобряване на моделите ни и за свързани научноизследователски цели. Необходимостта от съхранение се преразглежда периодично, а срокът зависи от вида на информацията и начина, по който се използва. Когато определяме срока за съхранение, отчитаме фактори като целта на обработването, количеството, естеството и чувствителността на информацията, потенциалния риск от вреди при неразрешено използване или разкриване и приложимите към нас правни задължения.
Как разработването на ChatGPT спазва законите за поверителност?
Използваме информацията за обучение по законосъобразен начин. Нашите базови модели се използват в широк спектър от полезни приложения, включително инструменти за достъпност, обслужване на клиенти, разработване на софтуер, персонализирано образование и научни изследвания. Тези възможности зависят от данни за обучение в голям мащаб, включително публично достъпна информация и информация от партньори — трети страни. Прилагаме защитни мерки през целия процес на обучение, включително стъпки за ограничаване на обработването на лична информация и намаляване на рисковете, както е описано в тази статия. Основаваме събирането и използването на лична информация, включена в информацията за обучение, на легитимни интереси съгласно законите за поверителност като ОРЗД. Те включват обучение и подобряване на моделите ни в полза на потребителите и обществото в съответствие с мисията ни да гарантираме, че изкуственият общ интелект е от полза за всички, както е обяснено по-подробно в нашата Политика за поверителност. Извършихме оценка на въздействието върху защитата на данните, за да гарантираме, че събираме и използваме тази информация законосъобразно и отговорно.
Кога информацията може да бъде споделяна или прехвърляна
Не „продаваме“ лична информация и разкриваме лична информация от данните за обучение само в ограничените случаи, описани в нашата Политика за поверителност. Например може да споделяме информация със свързани дружества, доставчици и доставчици на услуги, които подпомагат разработването, тестването и подобряването на нашите модели. Може също добросъвестно да разкриваме информация, ако смятаме, че това е необходимо за спазване на правно задължение или за защита на нашите права, безопасност и сигурност, както и тези на потребителите, служителите ни или обществеността, както е описано в нашата Политика за поверителност.
Тъй като инфраструктурата ни е глобална, личната информация в данните за обучение може да се обработва в държави извън ЕИП, Швейцария или Обединеното кралство, включително в Съединените щати. В тези случаи прилагаме подходящи защитни мерки, като решения относно адекватното ниво на защита или стандартни договорни клаузи, както е описано в нашата Политика за поверителност.
Вашите права и как да ги упражните
Отговаряме на искания за възражение и други подобни искания за упражняване на права. В резултат от изучаването на езика отговорите на ChatGPT понякога може да съдържат лична информация за хора, чиито данни се срещат многократно в публичното интернет пространство, например публични личности. Лицата в определени юрисдикции могат да възразят срещу обработването на личната им информация от нашите модели или да подадат други искания за упражняване на права на субектите на данни чрез нашия Портал за поверителност. Можете също да упражните тези права, като пишете на privacy@openai.com.
За да ни помогнете да оценим искането ви и да отговорим, предоставете достатъчно информация, за да разберем за каква лична информация се отнася то, например вашето име, съответните URL адреси, конкретни примери за резултати от модела или други подробности, които помагат за установяване на проблема. В някои случаи може да поискаме да потвърдите самоличността си или че информацията се отнася до вас, преди да предприемем действия. Повече информация за подаването на такива искания, включително добри практики и начина на разглеждането им, ще намерите в нашата статия в Помощния център относно премахването на лични данни от ChatGPT. Разглеждаме исканията в съответствие с приложимите закони за поверителност и отговаряме в установените от закона срокове.
Имайте предвид, че съгласно законите за поверителност някои права може да не са абсолютни. Например може да не успеем да изпълним искане, ако не можем да проверим съответната информация, ако искането не се отнася до лична информация, обработвана от OpenAI, ако е приложимо изключение или ако имаме друго законосъобразно основание за това. Исканията се оценяват поотделно и може да изискват съпоставяне на правата на поверителност с други важни съображения, като свободата на изразяване и обществения интерес.
Въпреки това се стремим да даваме приоритет на защитата на личната информация и да спазваме всички приложими закони за поверителност. Ако смятате, че не сме разгледали даден проблем по подходящ начин, имате право да подадете жалба до местния надзорен орган.
За повече информация относно практиките на OpenAI във връзка с личната информация, която събираме от или за вас, когато използвате нашия уебсайт, приложения и услуги, вижте нашата Политика за поверителност.
