مدلهای پایه OpenAI، از جمله مدلهایی که ChatGPT را به کار میاندازند، با استفاده از سه منبع اصلی اطلاعات توسعه مییابند: (۱) اطلاعاتی که بهصورت عمومی در اینترنت در دسترس است، (۲) اطلاعاتی که با همکاری اشخاص ثالث به آنها دسترسی پیدا میکنیم و (۳) اطلاعاتی که کاربران، مربیان انسانی و پژوهشگران ما ارائه یا تولید میکنند.
توسعه مدلهای پایه، مانند مدلهای مورد استفاده در ChatGPT، شامل چندین مرحله است؛ از جمله آمادهسازی دادههای تمرین، پیش تمرین و پستمرین، و نیز ارزیابی و بهبود مستمر پس از استقرار. ممکن است در این مراحل، انواع مختلف اطلاعات برای اهداف گوناگونی از جمله بهبود عملکرد، قابلیت اطمینان و ایمنی مدل به کار رود.
این مقاله مروری بر اطلاعاتی ارائه میدهد که برای کمک به توسعه این مدلها استفاده میکنیم، نحوه گردآوری و استفاده از این اطلاعات مطابق با قوانین حریم خصوصی، و تدابیر حفاظتیای که در سراسر فرایند تمرین به کار میگیریم. برای آگاهی از نحوه گردآوری و استفاده ما از اطلاعات کاربران خدماتمان، از جمله نحوه جلوگیری از استفاده از مکالمات ChatGPT برای کمک به بهبود مدلهایمان، لطفاً سیاست حفظ حریم خصوصی و این مقاله مرکز راهنمایی را ببینید.
ChatGPT چیست و چگونه کار میکند؟
ChatGPT خدمتی مبتنی بر هوش مصنوعی است که میتوانید از طریق اینترنت یا برنامه به آن دسترسی داشته باشید. میتوانید از ChatGPT برای طیف گستردهای از کارها استفاده کنید؛ از جمله سازماندهی و خلاصهسازی اطلاعات، کمک به ترجمه، پشتیبانی در برنامهنویسی، پژوهش و تحلیل، انجام کارهای چندمرحلهای با ابزارهای مختلف، تحلیل یا تولید تصویر، پرورش خلاقیت و ایدهپردازی و دیگر فعالیتهای روزمره. ChatGPT بهگونهای طراحی شده است که با یادگیری الگوها از حجم زیادی از اطلاعات، از جمله متن، تصویر، صدا و ویدیو، پرسشها و دستورالعملهای کاربران را درک کند و به آنها پاسخ دهد.
مدل هنگام تمرین، روابط موجود در این دادهها را تحلیل میکند—برای مثال اینکه کلمات معمولاً چگونه در یک بافت کنار هم ظاهر میشوند—و هنگام تولید پاسخ، با استفاده از این درک، محتملترین کلمه بعدی را یکییکی پیشبینی میکند. ممکن است متن به واحدهای کوچکتری تبدیل شود که گاهی «توکن» نامیده میشوند و میتوانند نمایانگر کلمات کامل، بخشهایی از کلمات یا علائم نگارشی باشند. توکنها اجزای سازنده متنی هستند که مدل پردازش میکند. به همین ترتیب، مدلهایی که انواع دیگری از محتوا مانند تصویر تولید میکنند، الگوهای ارتباط پیکسلها با یکدیگر و با زیرنویسهای مرتبط در دادههای تمرین را یاد میگیرند.
برای مثال، ممکن است در فرایند یادگیری مدل (که «تمرین» نامیده میشود) از آن خواسته شود جملهای مانند این را کامل کند: «او بهجای پیچیدن به چپ، به ___ پیچید.» پاسخهای مدل در اوایل تمرین عمدتاً تصادفیاند. اما هرچه مدل حجم بیشتری از متن را پردازش میکند و از آن میآموزد، در تشخیص الگوها و پیشبینی محتملترین کلمه بعدی بهتر میشود. این فرایند در میلیونها جمله تکرار میشود تا درک مدل پالایش و دقت آن بیشتر شود.
از آنجا که یک جمله را میتوان به چند روش پذیرفتنی کامل کرد—مانند «او بهجای پیچیدن به چپ، به راست پیچید»، «دور زد» یا «برگشت»—پاسخگویی مدل ذاتاً تا حدی تصادفی است. در نتیجه، ممکن است یک پرسش یکسان در دفعات مختلف پاسخهای متفاوتی داشته باشد.
مدلهای یادگیری ماشین از مجموعههای بزرگی از اعداد، موسوم به «وزنها» یا «پارامترها»، و کدی تشکیل شدهاند که این اعداد را تفسیر و استفاده میکند. این مدلها نسخههایی از دادههایی را که با آنها تمرین شدهاند ذخیره یا نگهداری نمیکنند. در عوض، همزمان با یادگیری مدل، مقادیر پارامترهای آن اندکی تنظیم میشوند تا الگوهای شناساییشده را بازتاب دهند. در مثال پیشین، مدل از پیشبینی کلمات تصادفی به پیشبینیهای دقیقتر رسید؛ نه با ذخیره جملات تمرین، بلکه با بهروزرسانی پارامترهای داخلی خود. مدل نسخهای از جملات، تصاویر یا فایلهای صوتی پردازششده در هنگام تمرین را نگه نمیدارد. ChatGPT مطالب را از دادههای تمرین خود «کپی و جایگذاری» نمیکند؛ همانطور که یک آموزگار پس از مطالعه گسترده میتواند با درک روابط میان ایدهها، مفاهیم را توضیح دهد، بیآنکه مطالب اصلی را حفظ کند یا عیناً بازگو کند. مدل هنگام تولید پاسخ به درخواست کاربر، از این وزنهای آموختهشده برای پیشبینی و ایجاد محتوای جدید استفاده میکند.
برای آموزش ChatGPT از چه نوع اطلاعاتی استفاده میشود؟
در مورد محتوای عمومی اینترنت، فقط از اطلاعاتی استفاده میکنیم که آزادانه و آشکارا در اینترنت در دسترس باشند. این اطلاعات ممکن است شامل صفحات وب، انجمنها، وبلاگها، پستها و دیگر محتوای آنلاینِ در دسترس عموم باشد. برای مثال، اگر در یک انجمن گفتوگوی آنلاین عمومی شرکت کنید یا مطلبی عمومی در وبلاگ یا جای دیگری منتشر کنید، ممکن است از آن محتوای عمومی برای تمرین مدل استفاده کنیم. بااینحال، برای کاهش پردازش اطلاعات شخصی در فرایند تمرین خود اقداماتی انجام میدهیم. هنگام گردآوری محتوای عمومی اینترنت، عمداً دادهای از منابعی که میدانیم پشت دیوار پرداخت هستند یا از دارکوب جمعآوری نمیکنیم. همچنین برای حذف مطالبی که نمیخواهیم مدلهایمان از آنها بیاموزند فیلترهایی اعمال میکنیم؛ مانند نفرتپراکنی، محتوای بزرگسالان، وبسایتهای گردآورنده اطلاعات شخصی و هرزنامه. سپس از اطلاعات باقیمانده برای تمرین مدلهایمان استفاده میشود.
مالکان وبسایتها میتوانند با استفاده از کنترلهای استاندارد وب، مانند robots.txt، دسترسی به محتوای عمومی وبسایتشان برای تمرین را مدیریت کنند. برای این کار میتوانند دسترسی GPTBot را مسدود کنند؛ رباتی که ممکن است محتوای عمومی را برای کمک به تمرین مدلهای ما پیمایش کند. برای کمک به مالکان وبسایتها در مدیریت نحوه تعامل وبسایت و محتوایشان با سامانههای هوش مصنوعی ما، راهنماییهایی ارائه میکنیم.
همچنین برای کمک به تمرین و بهبود مدلهایمان از اطلاعات شرکای شخص ثالث استفاده میکنیم. این اطلاعات ممکن است شامل دادههای موجود در مجموعهدادههایی باشد که طبق توافق با اشخاص ثالث به آنها دسترسی داریم، و نیز اطلاعاتی که مربیان انسانی و پژوهشگران، در چارچوب مجاز سیاستها و توافقهایمان، ارائه یا تولید میکنند. این کار به بهبود کیفیت، ایمنی و عملکرد مدلهای ما کمک میکند. این منابع بسته به مجموعهداده ممکن است شامل متن، تصویر، صدا، ویدیو یا انواع دیگری از داده باشند.
همچنین در برخی فرایندهای تمرین بهطور فزایندهای از دادههای مصنوعی استفاده میکنیم. برای مثال، ممکن است از اطلاعات و مدلهایمان برای تولید درخواستهای مصنوعی، نمونههای چندزبانه یا دیگر مطالب تمرینی استفاده کنیم. دادههای مصنوعی میتوانند به بهبود عملکرد مدل کمک کنند؛ از جمله با تکمیل دادههای تمرین در حوزههایی که داده در آنها کم یا نامتوازن است. این دادهها همچنین میتوانند از رویکردهای تقویتکننده حریم خصوصی در توسعه مدل پشتیبانی کنند.
آیا برای آموزش ChatGPT از اطلاعات شخصی استفاده میشود؟
بخش قابلتوجهی از محتوای آنلاین حاوی اطلاعاتی درباره افراد است؛ بنابراین ممکن است دادههای تمرین ما بهطور اتفاقی شامل اطلاعات شخصی باشند. بااینحال، برای کاهش پردازش اطلاعات شخصی در فرایند تمرین خود اقداماتی انجام میدهیم.
از دادههای تمرین برای توسعه قابلیتهای مدل—مانند پیشبینی، استدلال و حل مسئله—استفاده میکنیم، نه برای ایجاد نمایه افراد، تماس با آنها یا شخصیسازی تبلیغات برایشان.
در برخی موارد، مدلها ممکن است از اطلاعات شخصی بیاموزند تا نحوه کاربرد عناصری مانند نامها و نشانیها در زبان را درک کنند یا چهرههای عمومی و نهادهای شناختهشده را تشخیص دهند. این کار به مدل کمک میکند پاسخهایی دقیقتر و متناسبتر با بافت تولید کند.
چگونه از اطلاعات شخصی هنگام تمرین محافظت میشود؟
برای محدود کردن پردازش اطلاعات شخصی هنگام تمرین، فعالانه اقدام میکنیم. برای مثال، منابع شناختهشدهای را که حجم زیادی از دادههای شخصی را گردآوری میکنند کنار میگذاریم، برای کاهش اطلاعات شخصی در فرایند تمرین فیلترهایی اعمال میکنیم و برای شناسایی و حذف محتوای تکراری اقدام میکنیم تا خطر تکرار دادههای تمرین کاهش یابد. افزون بر این، مدلهایمان را تمرین میدهیم تا به درخواستهای مربوط به اطلاعات خصوصی یا حساس افراد پاسخ ندهند.
مدت نگهداری اطلاعات
اطلاعات موجود در دادههای تمرین را فقط تا زمانی نگه میداریم که برای اهداف شرحدادهشده در این مقاله و سیاست حفظ حریم خصوصی ما بهطور معقول ضروری باشد؛ از جمله برای توسعه و بهبود مدلهایمان و اهداف مرتبط با پژوهش علمی. ضرورت ادامه نگهداری بهصورت دورهای بازبینی میشود و مدت آن بسته به نوع اطلاعات و نحوه استفاده از آن متفاوت است. برای تعیین مدت نگهداری، عواملی مانند هدفمان از پردازش اطلاعات، حجم، ماهیت و حساسیت اطلاعات، خطر احتمالی آسیب ناشی از استفاده یا افشای غیرمجاز و هرگونه تعهد قانونی خود را در نظر میگیریم.
توسعه ChatGPT چگونه با قوانین حریم خصوصی مطابقت دارد؟
ما بهطور قانونی از اطلاعات تمرین استفاده میکنیم. مدلهای پایه ما طیف گستردهای از کاربردهای سودمند را به کار میاندازند؛ از جمله ابزارهای دسترسپذیری، پشتیبانی مشتری، توسعه نرمافزار، آموزش شخصیسازیشده و پژوهش علمی. این قابلیتها به دادههای تمرین در مقیاس بزرگ، از جمله اطلاعات عمومی و اطلاعات شرکای شخص ثالث، وابستهاند. در سراسر فرایند تمرین تدابیر حفاظتی اعمال میکنیم؛ از جمله اقداماتی که برای کاهش پردازش اطلاعات شخصی در فرایند تمرین و کاستن از خطرها طراحی شدهاند و در این مقاله شرح داده شدهاند. گردآوری و استفاده ما از اطلاعات شخصی موجود در اطلاعات تمرین، بر اساس منافع مشروع تحت قوانین حریم خصوصی مانند GDPR انجام میشود؛ از جمله برای تمرین و بهبود مدلهایمان به نفع کاربران و جامعه گستردهتر، همسو با مأموریت ما برای اطمینان از اینکه هوش مصنوعی عمومی به سود همه باشد. جزئیات بیشتر در سیاست حفظ حریم خصوصی ما آمده است. برای کمک به اطمینان از اینکه این اطلاعات را بهطور قانونی و مسئولانه گردآوری و استفاده میکنیم، ارزیابی تأثیر حفاظت از دادهها را تکمیل کردهایم.
مواردی که ممکن است اطلاعات به اشتراک گذاشته یا منتقل شود
ما اطلاعات شخصی را «نمیفروشیم» و اطلاعات شخصی موجود در دادههای تمرین را فقط در شرایط محدودِ شرحدادهشده در سیاست حفظ حریم خصوصی خود افشا میکنیم. برای مثال، ممکن است اطلاعات را با شرکتهای وابسته، عرضهکنندگان و ارائهدهندگان خدماتی به اشتراک بگذاریم که از توسعه، آزمایش و بهبود مدلهای ما پشتیبانی میکنند. همچنین ممکن است با حسن نیت اطلاعات را افشا کنیم، اگر معتقد باشیم این اقدام برای انجام یک تعهد قانونی یا محافظت از حقوق، ایمنی و امنیت خود و کاربران، کارکنان یا عموم مردم ضروری است؛ همانطور که در سیاست حفظ حریم خصوصی ما شرح داده شده است.
از آنجا که زیرساخت ما جهانی است، ممکن است اطلاعات شخصی موجود در دادههای تمرین در کشورهای خارج از منطقه اقتصادی اروپا، سوئیس یا بریتانیا (از جمله ایالات متحده) پردازش شود. در چنین مواردی، تدابیر حفاظتی مناسب مانند تصمیمهای کفایت یا بندهای قراردادی استاندارد را مطابق با توضیحات سیاست حفظ حریم خصوصی خود اعمال میکنیم.
حقوق شما و نحوه اعمال آنها
ما به درخواستهای اعتراض و درخواستهای مشابه برای اعمال حقوق پاسخ میدهیم. در نتیجه یادگیری زبان، پاسخهای ChatGPT ممکن است گاهی شامل اطلاعات شخصی افرادی باشد که اطلاعاتشان چندین بار در اینترنت عمومی ظاهر شده است (برای مثال، چهرههای عمومی). افراد در برخی حوزههای قضایی میتوانند از طریق درگاه خصوصی ما به پردازش اطلاعات شخصی خود توسط مدلهایمان اعتراض کنند یا درخواستهای دیگری برای اعمال حقوق صاحبان داده ارائه دهند. همچنین میتوانید با ارسال پیام به privacy@openai.com این حقوق را اعمال کنید.
برای کمک به ما در ارزیابی و پاسخگویی به درخواستتان، لطفاً اطلاعات کافی ارائه دهید تا متوجه شویم درخواست شما به کدام اطلاعات شخصی مربوط است؛ مانند نامتان، نشانیهای اینترنتی مرتبط، نمونههای مشخص از خروجیهای مدل یا جزئیات دیگری که به شناسایی موضوع کمک میکنند. در برخی موارد، ممکن است پیش از اقدام از شما بخواهیم هویتتان را تأیید کنید یا تأیید کنید که اطلاعات به شما مربوط است. اطلاعات بیشتر درباره نحوه ارائه این درخواستها، از جمله بهترین شیوهها و نحوه بررسی درخواستها، در مقاله مرکز راهنمایی ما درباره حذف دادههای شخصی از ChatGPT در دسترس است. درخواستها را مطابق با قوانین حریم خصوصی قابلاجرا بررسی میکنیم و در مهلتهای قانونی مربوط پاسخ میدهیم.
لطفاً توجه داشته باشید که طبق قوانین حریم خصوصی، برخی حقوق ممکن است مطلق نباشند. برای مثال، ممکن است نتوانیم درخواستی را اجرا کنیم اگر نتوانیم اطلاعات مرتبط را تأیید کنیم، درخواست به اطلاعات شخصی پردازششده توسط OpenAI مربوط نباشد، موردی از معافیت اعمال شود یا دلیل قانونی دیگری برای انجام ندادن آن داشته باشیم. درخواستها بهصورت موردی ارزیابی میشوند و ممکن است مستلزم ایجاد توازن میان حقوق حریم خصوصی و ملاحظات مهم دیگری مانند آزادی بیان و منافع عمومی باشند.
بااینحال، میکوشیم حفاظت از اطلاعات شخصی را در اولویت قرار دهیم و از همه قوانین حریم خصوصی قابلاجرا پیروی کنیم. اگر احساس میکنید به موضوعی بهاندازه کافی رسیدگی نکردهایم، حق دارید نزد نهاد نظارتی محلی خود شکایت کنید.
برای اطلاعات بیشتر درباره رویههای OpenAI در خصوص اطلاعات شخصیای که هنگام استفاده شما از وبسایت، برنامهها و خدماتمان از شما یا درباره شما گردآوری میکنیم، لطفاً سیاست حفظ حریم خصوصی ما را ببینید.
