مدلهای بنیادین OpenAI، از جمله مدلهایی که ChatGPT را پشتیبانی میکنند، با استفاده از سه منبع اصلی اطلاعات توسعه مییابند: (۱) اطلاعاتی که بهصورت عمومی در اینترنت در دسترس است، (۲) اطلاعاتی که برای دسترسی به آن با اشخاص ثالث همکاری میکنیم، و (۳) اطلاعاتی که کاربران، مربیان انسانی و پژوهشگران ما ارائه یا تولید میکنند.
توسعه مدلهای بنیادینی مانند مدلهای بهکاررفته در ChatGPT شامل چند مرحله است، از جمله آمادهسازی دادههای تمرین، پیش تمرین و پساتمرین، و همچنین ارزیابی و بهبود مستمر پس از استقرار. در این مراحل ممکن است انواع مختلفی از اطلاعات برای اهداف گوناگون، از جمله بهبود عملکرد، قابلیت اتکا و ایمنی مدل، استفاده شود.
این مقاله مروری ارائه میدهد بر اطلاعاتی که برای کمک به توسعه این مدلها استفاده میکنیم، نحوه گردآوری و استفاده از آن اطلاعات در چارچوب قوانین حریم خصوصی، و تدابیر حفاظتیای که در سراسر فرایند تمرین به کار میبریم. برای آگاهی از اینکه چگونه اطلاعات کاربران خدماتمان را گردآوری و استفاده میکنیم، از جمله نحوه انصراف از استفاده از گفتگوهای ChatGPT برای کمک به بهبود مدلهایمان، لطفاً سیاست حفظ حریم خصوصی و این مقاله مرکز راهنمایی را ببینید.
ChatGPT چیست و چگونه کار میکند؟
ChatGPT خدمتی مبتنی بر هوش مصنوعی است که میتوانید از طریق اینترنت یا اپلیکیشن به آن دسترسی داشته باشید. میتوانید از ChatGPT برای طیف گستردهای از کارها استفاده کنید، از جمله سازماندهی و خلاصهسازی اطلاعات، کمک به ترجمه، پشتیبانی در کدنویسی، پژوهش و تحلیل، انجام کارهای چندمرحلهای در ابزارهای مختلف، تحلیل یا تولید تصویر، الهامبخشی به خلاقیت و ایدهها، و دیگر فعالیتهای روزمره. ChatGPT طوری طراحی شده است که با یادگیری الگوها از حجم زیادی از اطلاعات، از جمله متن، تصویر، صدا و ویدئو، پرسشها و دستورهای کاربران را بفهمد و به آنها پاسخ دهد.
در طول تمرین، مدل روابط درون این دادهها را تحلیل میکند—مثلاً اینکه واژهها معمولاً چگونه در یک بافت کنار هم ظاهر میشوند—و هنگام تولید پاسخ، از این فهم برای پیشبینی محتملترین واژه بعدی، واژه به واژه، استفاده میکند. متن ممکن است به واحدهای کوچکتری تبدیل شود که گاهی «توکنها» نامیده میشوند و میتوانند نماینده واژههای کامل، بخشهایی از واژهها یا نشانههای نگارشی باشند. توکنها اجزای سازنده متن هستند که مدل آنها را پردازش میکند. به همین ترتیب، مدلهایی که شکلهای دیگری از محتوا مانند تصویر تولید میکنند، الگوهای ارتباط پیکسلها با یکدیگر و با کپشنهای مرتبط در دادههای تمرین را یاد میگیرند.
برای مثال، در فرایند یادگیری مدل (که «تمرین» نامیده میشود)، ممکن است از مدل خواسته شود جملهای مانند این را کامل کند: «بهجای اینکه به چپ بپیچد، به ___ پیچید.» در اوایل تمرین، پاسخهای آن عمدتاً تصادفی است. اما وقتی مدل حجم زیادی از متن را پردازش میکند و از آن میآموزد، در تشخیص الگوها و پیشبینی محتملترین واژه بعدی بهتر میشود. این فرایند روی میلیونها جمله تکرار میشود تا فهم مدل دقیقتر و دقت آن بیشتر شود.
از آنجا که راههای معقول متعددی برای کامل کردن یک جمله وجود دارد—مانند «بهجای اینکه به چپ بپیچد، به راست پیچید»، «دور زد» یا «برگشت»—در نحوه پاسخدهی مدل، عنصری ذاتی از تصادفی بودن وجود دارد. در نتیجه، یک پرسش یکسان ممکن است در درخواستهای مختلف پاسخهای متفاوتی به همراه داشته باشد.
مدلهای یادگیری ماشین از مجموعههای بزرگی از اعداد تشکیل شدهاند که «وزنها» یا «پارامترها» نامیده میشوند، همراه با کدی که این اعداد را تفسیر و استفاده میکند. این مدلها نسخههایی از دادههایی را که با آنها تمرین دیدهاند ذخیره یا نگهداری نمیکنند. در عوض، هنگامی که مدل یاد میگیرد، مقادیر پارامترهایش اندکی تنظیم میشود تا الگوهایی را که شناسایی کرده بازتاب دهد. در مثال پیشین، مدل از پیشبینی واژههای تصادفی به پیشبینیهای دقیقتر رسید—نه با ذخیره کردن جملههای تمرین، بلکه با بهروزرسانی پارامترهای داخلی خود. مدل نسخههایی از جملهها، تصاویر یا صداهایی را که در طول تمرین پردازش میکند نگه نمیدارد. ChatGPT از دادههای تمرین خود «کپی و جایگذاری» نمیکند—مشابه معلمی که پس از مطالعه گسترده، میتواند با فهم روابط میان ایدهها مفاهیم را توضیح دهد، بدون آنکه مطالب اصلی را کلمهبهکلمه حفظ یا بازتولید کند. هنگام تولید پاسخ به درخواست کاربر، مدل از این وزنهای آموختهشده برای پیشبینی و ایجاد محتوای تازه استفاده میکند.
برای آموزش ChatGPT از چه نوع اطلاعاتی استفاده میشود؟
در مورد محتوای اینترنتیِ در دسترس عموم، ما فقط از اطلاعاتی استفاده میکنیم که آزادانه و آشکارا در اینترنت قابل دسترسی است. این میتواند شامل صفحات وب در دسترس عموم، انجمنهای عمومی، وبلاگهای عمومی، پستهای عمومی و سایر محتوای آنلاینِ در دسترس عموم باشد. برای مثال، اگر در یک انجمن گفتوگوی آنلاینِ در دسترس عموم شرکت کنید یا وبلاگ یا پست عمومی دیگری منتشر کنید، ممکن است از آن محتوای عمومی برای اهداف تمرین مدل استفاده کنیم. با این حال، ما اقداماتی انجام میدهیم تا پردازش اطلاعات شخصی در فرایند تمرین خود را کاهش دهیم. هنگام گردآوری محتوای اینترنتیِ در دسترس عموم، عمداً دادههایی را از منابعی که میدانیم پشت دیوار پرداخت هستند یا از وب تاریک جمعآوری نمیکنیم. همچنین، فیلترهایی اعمال میکنیم تا موادی را که نمیخواهیم مدلهایمان از آنها بیاموزند حذف کنیم؛ مانند نفرتپراکنی، محتوای بزرگسالان، سایتهایی که اطلاعات شخصی را گردآوری میکنند، و هرزنامه. سپس اطلاعات باقیمانده برای تمرین مدلهای ما استفاده میشود.
مالکان وبسایتها میتوانند با استفاده از کنترلهای استاندارد وب مانند robots.txt برای منع GPTBot، که ممکن است محتوای عمومی را برای کمک به تمرین مدلهای ما بخزد، مدیریت کنند که آیا محتوای عمومی سایتهایشان برای استفاده در تمرین قابل دسترسی باشد یا نه. ما برای کمک به مالکان وبسایتها در مدیریت نحوه تعامل سایتها و محتوایشان با سامانههای هوش مصنوعی ما، راهنمایی ارائه میکنیم.
ما همچنین از اطلاعات شرکای شخص ثالث برای کمک به تمرین و بهبود مدلهای خود استفاده میکنیم. این ممکن است شامل اطلاعات موجود در مجموعهدادههایی باشد که از طریق توافق با اشخاص ثالث به آنها دسترسی داریم، و نیز اطلاعاتی که مربیان انسانی و پژوهشگران، در موارد مجاز طبق سیاستها و توافقهای ما، ارائه یا تولید میکنند. این کار به بهبود کیفیت، ایمنی و عملکرد مدلهای ما کمک میکند. این منابع بسته به مجموعهداده ممکن است شامل متن، تصویر، صدا، ویدئو یا انواع دیگر داده باشند.
ما همچنین بهطور فزایندهای در برخی فرایندهای تمرین از دادههای مصنوعی استفاده میکنیم. برای مثال، ممکن است از اطلاعات و مدلهای خود برای تولید اعلانهای مصنوعی، نمونههای چندزبانه یا سایر مواد تمرینی استفاده کنیم. دادههای مصنوعی میتوانند به بهبود عملکرد مدل کمک کنند، از جمله با تکمیل دادههای تمرین در حوزههایی که داده در آنها کم یا نامتوازن است، و همچنین ممکن است از رویکردهای تقویتکننده حریم خصوصی در توسعه مدل پشتیبانی کنند.
آیا از اطلاعات شخصی برای آموزش ChatGPT استفاده میشود؟
بخش قابل توجهی از محتوای آنلاین به اطلاعات مربوط به افراد میپردازد، بنابراین دادههای تمرین ما ممکن است بهطور اتفاقی شامل اطلاعات شخصی باشد. با این حال، ما اقداماتی انجام میدهیم تا پردازش اطلاعات شخصی در فرایند تمرین خود را کاهش دهیم.
ما از دادههای تمرین برای توسعه تواناییهای مدل—مانند پیشبینی، استدلال و حل مسئله—استفاده میکنیم، نه برای ساختن پروفایل افراد، تماس با آنها یا شخصیسازی تبلیغات برایشان.
در برخی موارد، مدلها ممکن است از اطلاعات شخصی بیاموزند تا بفهمند عناصری مانند نامها و نشانیها در زبان چگونه کار میکنند، یا چهرههای عمومی و نهادهای شناختهشده را تشخیص دهند. این کار به مدل کمک میکند پاسخهایی دقیقتر و متناسبتر با بافت تولید کند.
اطلاعات شخصی در طول تمرین چگونه محافظت میشود؟
ما برای محدود کردن پردازش اطلاعات شخصی در طول تمرین، اقدامات فعالانه انجام میدهیم. برای مثال، منابع شناختهشدهای را که حجم زیادی از دادههای شخصی را گردآوری میکنند کنار میگذاریم، برای کاهش اطلاعات شخصی در فرایند تمرین فیلتر اعمال میکنیم، و برای شناسایی و حذف محتوای تکراری اقدام میکنیم تا خطر تکرار دادههای تمرین کاهش یابد. علاوه بر این، مدلهای خود را تمرین میدهیم تا از پاسخ دادن به درخواستهای مربوط به اطلاعات خصوصی یا حساس درباره افراد خودداری کنند.
مدت نگهداری اطلاعات
ما اطلاعات موجود در دادههای تمرین را فقط تا زمانی نگه میداریم که برای اهداف توصیفشده در این مقاله و سیاست حفظ حریم خصوصی ما بهطور معقول ضروری باشد، از جمله برای توسعه و بهبود مدلهایمان و برای اهداف پژوهش علمی مرتبط. نگهداری اطلاعات به بازبینی دورهای وابسته است تا ضرورت ادامه آن تضمین شود، و بسته به نوع اطلاعات و نحوه استفاده از آن متفاوت است. در تعیین مدت نگهداری، عواملی مانند هدف ما از پردازش اطلاعات، میزان، ماهیت و حساسیت اطلاعات، خطر احتمالی آسیب ناشی از استفاده یا افشای غیرمجاز، و هرگونه تعهد قانونیِ قابل اعمال بر خود را در نظر میگیریم.
توسعه ChatGPT چگونه با قوانین حریم خصوصی سازگار است؟
ما از اطلاعات تمرینی بهصورت قانونی استفاده میکنیم. مدلهای بنیادین ما طیف گستردهای از کاربردهای مفید را پشتیبانی میکنند—از جمله ابزارهای دسترسپذیری، پشتیبانی مشتری، توسعه نرمافزار، آموزش شخصیسازیشده و پژوهش علمی. این تواناییها به دادههای تمرینی در مقیاس بزرگ، از جمله اطلاعات در دسترس عموم و اطلاعات شرکای شخص ثالث، وابستهاند. ما در سراسر فرایند تمرین، تدابیر حفاظتی به کار میبریم، از جمله اقداماتی که برای کاهش پردازش اطلاعات شخصی در فرایند تمرین و کاهش ریسکها طراحی شدهاند، همانطور که در این مقاله توضیح داده شده است. ما گردآوری و استفاده از اطلاعات شخصیِ موجود در اطلاعات تمرینی را بر مبنای منافع مشروع طبق قوانین حریم خصوصی مانند GDPR انجام میدهیم؛ از جمله برای تمرین و بهبود مدلهایمان برای کاربران و جامعه گستردهتر، همسو با مأموریت ما برای اطمینان از اینکه هوش مصنوعی عمومی به نفع همه باشد، همانطور که با جزئیات بیشتر در سیاست حفظ حریم خصوصی ما توضیح داده شده است. ما ارزیابی اثرات حفاظت از داده را تکمیل کردهایم تا کمک کند اطمینان یابیم این اطلاعات را بهصورت قانونی و مسئولانه گردآوری و استفاده میکنیم.
زمانی که اطلاعات ممکن است به اشتراک گذاشته یا منتقل شود
ما اطلاعات شخصی را «نمیفروشیم» و اطلاعات شخصی موجود در دادههای تمرین را فقط در شرایط محدودی که در سیاست حفظ حریم خصوصی ما توضیح داده شده افشا میکنیم. برای مثال، ممکن است اطلاعات را با شرکتهای وابسته، فروشندگان و ارائهدهندگان خدماتی به اشتراک بگذاریم که از توسعه، آزمایش و بهبود مدلهای ما پشتیبانی میکنند. همچنین ممکن است در صورتی که با حسن نیت باور داشته باشیم چنین اقدامی برای رعایت یک تعهد قانونی یا برای حفاظت از حقوق، ایمنی و امنیت ما و کاربران، کارکنان یا عموم مردم ضروری است، همانطور که در سیاست حفظ حریم خصوصی ما توضیح داده شده، اطلاعات را افشا کنیم.
از آنجا که زیرساخت ما جهانی است، اطلاعات شخصی موجود در دادههای تمرین ممکن است در کشورهایی خارج از EEA، سوئیس یا بریتانیا (از جمله در ایالات متحده) پردازش شود. در چنین مواردی، ما تدابیر حفاظتی مناسب مانند تصمیمهای کفایت یا بندهای قراردادی استاندارد را به کار میبریم، همانطور که در سیاست حفظ حریم خصوصی ما توضیح داده شده است.
حقوق شما و نحوه اعمال آنها
ما به درخواستهای اعتراض و درخواستهای مشابهِ مربوط به حقوق پاسخ میدهیم. در نتیجه یادگیری زبان، پاسخهای ChatGPT گاهی ممکن است شامل اطلاعات شخصی درباره افرادی باشد که اطلاعات شخصیشان چندین بار در اینترنت عمومی ظاهر شده است (برای مثال، چهرههای عمومی). افراد در برخی حوزههای قضایی میتوانند از طریق درگاه خصوصی ما به پردازش اطلاعات شخصی خود توسط مدلهای ما اعتراض کنند یا سایر درخواستهای مربوط به حقوق صاحب داده را مطرح کنند. همچنین میتوانید این حقوق را با تماس با privacy@openai.com اعمال کنید.
برای اینکه بتوانیم درخواست شما را ارزیابی کنیم و به آن پاسخ دهیم، لطفاً اطلاعات کافی ارائه کنید تا بفهمیم درخواستتان به کدام اطلاعات شخصی مربوط است؛ مانند نام شما، URLهای مرتبط، نمونههای مشخصی از خروجیهای مدل، یا جزئیات دیگری که به شناسایی مسئله کمک میکند. در برخی موارد، ممکن است پیش از اقدام از شما بخواهیم هویت خود را تأیید کنید یا تأیید کنید که اطلاعات به شما مربوط است. اطلاعات بیشتر درباره نحوه ثبت این درخواستها، از جمله بهترین روشها و چگونگی بررسی درخواستها، در مقاله مرکز راهنمایی ما درباره حذف دادههای شخصی از ChatGPT در دسترس است. ما درخواستها را مطابق با قوانین حریم خصوصیِ قابل اجرا بررسی میکنیم و در مهلتهای قانونیِ مربوط پاسخ میدهیم.
لطفاً توجه داشته باشید که طبق قوانین حریم خصوصی، برخی حقوق ممکن است مطلق نباشند. برای مثال، ممکن است نتوانیم در مواردی به یک درخواست عمل کنیم که نتوانیم اطلاعات مربوط را تأیید کنیم، درخواست به اطلاعات شخصی پردازششده توسط OpenAI مربوط نباشد، استثنایی اعمال شود، یا دلیل قانونی دیگری برای این کار داشته باشیم. درخواستها بهصورت موردبهمورد ارزیابی میشوند و ممکن است مستلزم سنجش حقوق حریم خصوصی در برابر ملاحظات مهم دیگری مانند آزادی بیان و منفعت عمومی باشند.
با این حال، ما میکوشیم حفاظت از اطلاعات شخصی را در اولویت قرار دهیم و از همه قوانین حریم خصوصیِ قابل اجرا پیروی کنیم. اگر احساس میکنید به مسئلهای بهطور کافی رسیدگی نکردهایم، حق دارید نزد مرجع نظارتی محلی خود شکایت ثبت کنید.
برای اطلاعات بیشتر درباره رویههای OpenAI در ارتباط با اطلاعات شخصیای که هنگام استفاده شما از وبسایت، اپلیکیشنها و خدمات ما از شما یا درباره شما گردآوری میکنیم، لطفاً سیاست حفظ حریم خصوصی ما را ببینید.
