Model asas OpenAI, termasuk model yang menguasakan ChatGPT, dibangunkan menggunakan tiga sumber maklumat utama: (1) maklumat yang tersedia secara umum di internet, (2) maklumat yang kami akses melalui kerjasama dengan pihak ketiga dan (3) maklumat yang diberikan atau dijana oleh pengguna, pelatih manusia dan penyelidik kami.
Pembangunan model asas seperti yang digunakan dalam ChatGPT melibatkan beberapa peringkat, termasuk penyediaan data latihan, latihan awal dan latihan susulan, serta penilaian dan penambahbaikan berterusan selepas penggunaan. Jenis maklumat yang berbeza mungkin digunakan pada peringkat ini untuk pelbagai tujuan, termasuk meningkatkan prestasi, kebolehpercayaan dan keselamatan model.
Artikel ini memberikan gambaran keseluruhan tentang maklumat yang kami gunakan untuk membantu membangunkan model ini, cara kami mengumpul dan menggunakan maklumat tersebut dengan mematuhi undang-undang privasi serta langkah perlindungan yang kami gunakan sepanjang proses latihan. Untuk memahami cara kami mengumpul dan menggunakan maklumat daripada pengguna perkhidmatan kami, termasuk cara memilih agar perbualan ChatGPT tidak digunakan untuk membantu menambah baik model kami, sila lihat Dasar Privasi kami dan artikel Pusat Bantuan ini.
Apakah itu ChatGPT dan bagaimanakah ia berfungsi?
ChatGPT ialah perkhidmatan berasaskan kecerdasan buatan yang boleh anda akses melalui internet atau aplikasi. Anda boleh menggunakan ChatGPT untuk pelbagai tugas, termasuk menyusun dan meringkaskan maklumat, membantu penterjemahan, menyokong pengekodan, penyelidikan dan analisis, menyelesaikan tugas berbilang langkah merentas alatan, menganalisis atau menjana imej, mencetuskan kreativiti dan idea serta aktiviti harian yang lain. ChatGPT direka bentuk untuk memahami dan menjawab soalan serta arahan pengguna dengan mempelajari corak daripada sejumlah besar maklumat, termasuk teks, imej, audio dan video.
Semasa latihan, model menganalisis hubungan dalam data ini—seperti cara perkataan biasanya muncul bersama-sama mengikut konteks—lalu menggunakan pemahaman tersebut untuk meramalkan perkataan seterusnya yang paling berkemungkinan apabila menjana respons, satu perkataan pada satu masa. Teks boleh ditukarkan kepada unit yang lebih kecil, kadangkala dipanggil “token”, yang mungkin mewakili seluruh perkataan, sebahagian perkataan atau tanda baca. Token ialah unsur asas teks yang diproses oleh model. Begitu juga, model yang menjana bentuk kandungan lain seperti imej mempelajari corak hubungan antara piksel dan antara piksel dengan kapsyen yang berkaitan dalam data latihan.
Sebagai contoh, semasa proses pembelajaran model (dikenali sebagai “latihan”), model mungkin ditugaskan untuk melengkapkan ayat seperti: “Daripada membelok ke kiri, dia membelok ke ___.” Pada peringkat awal latihan, responsnya sebahagian besarnya rawak. Namun, apabila model memproses dan belajar daripada sejumlah besar teks, model menjadi lebih baik dalam mengenal pasti corak dan meramalkan perkataan seterusnya yang paling berkemungkinan. Proses ini diulangi merentas jutaan ayat untuk memperhalus pemahamannya dan meningkatkan ketepatannya.
Oleh sebab terdapat beberapa cara yang munasabah untuk melengkapkan ayat—seperti “Daripada membelok ke kiri, dia membelok ke kanan,” “berpusing” atau “kembali”—terdapat unsur kerawakan dalam cara model memberikan respons. Oleh itu, soalan yang sama mungkin menghasilkan jawapan yang berbeza bagi pertanyaan yang berlainan.
Model pembelajaran mesin terdiri daripada set nombor yang besar, dikenali sebagai “pemberat” atau “parameter”, bersama-sama kod yang mentafsir dan menggunakan nombor tersebut. Model ini tidak menyimpan atau mengekalkan salinan data yang digunakan untuk melatihnya. Sebaliknya, apabila model belajar, nilai parameternya dilaraskan sedikit demi sedikit untuk mencerminkan corak yang telah dikenal pasti. Dalam contoh terdahulu, model bertambah baik daripada meramalkan perkataan secara rawak kepada membuat ramalan yang lebih tepat—bukan dengan menyimpan ayat latihan, tetapi dengan mengemas kini parameter dalamannya. Model tidak mengekalkan salinan ayat, imej atau audio yang diproses semasa latihan. ChatGPT tidak “menyalin dan menampal” daripada data latihannya—seperti seorang guru yang, selepas membuat kajian mendalam, boleh menerangkan konsep dengan memahami hubungan antara idea tanpa menghafal atau menghasilkan semula bahan asal kata demi kata. Apabila menjana respons kepada permintaan pengguna, model menggunakan pemberat yang telah dipelajari ini untuk meramalkan dan mencipta kandungan baharu.
Apakah jenis maklumat yang digunakan untuk mengajar ChatGPT?
Bagi kandungan internet yang tersedia secara umum, kami hanya menggunakan maklumat yang boleh diakses secara bebas dan terbuka di internet. Ini mungkin termasuk halaman web, forum, blog, hantaran dan kandungan dalam talian lain yang tersedia secara umum. Sebagai contoh, jika anda menyertai forum perbincangan dalam talian yang tersedia secara umum atau menerbitkan blog atau hantaran umum yang lain, kami mungkin menggunakan kandungan yang boleh diakses oleh orang ramai itu untuk tujuan latihan model. Namun, kami mengambil langkah untuk mengurangkan pemprosesan maklumat peribadi dalam proses latihan kami. Semasa mengumpul kandungan internet yang tersedia secara umum, kami tidak dengan sengaja mengumpulkan data daripada sumber yang diketahui berada di sebalik tembok berbayar atau daripada web gelap. Selain itu, kami menggunakan penapis untuk membuang bahan yang tidak mahu dipelajari oleh model kami, seperti ucapan kebencian, kandungan dewasa, laman yang mengagregatkan maklumat peribadi dan spam. Maklumat yang tinggal kemudiannya digunakan untuk melatih model kami.
Pemilik laman web boleh mengurus sama ada kandungan yang tersedia secara umum daripada laman mereka boleh diakses untuk digunakan dalam latihan dengan menggunakan kawalan web standard seperti robots.txt untuk menyekat GPTBot, yang mungkin merangkak kandungan tersedia umum bagi membantu melatih model kami. Kami menyediakan panduan untuk membantu pemilik laman web mengurus cara laman dan kandungan mereka berinteraksi dengan sistem AI kami.
Kami juga menggunakan maklumat daripada rakan kongsi pihak ketiga untuk membantu melatih dan menambah baik model kami. Ini mungkin termasuk maklumat dalam set data yang kami akses melalui perjanjian dengan pihak ketiga, serta maklumat yang diberikan atau dijana oleh pelatih manusia dan penyelidik apabila dibenarkan oleh dasar dan perjanjian kami. Ini membantu meningkatkan kualiti, keselamatan dan prestasi model kami. Sumber ini mungkin merangkumi teks, imej, audio, video atau jenis data lain, bergantung pada set data tersebut.
Kami juga semakin banyak menggunakan data sintetik dalam sesetengah proses latihan. Sebagai contoh, kami mungkin menggunakan maklumat dan model kami untuk menjana gesaan sintetik, contoh berbilang bahasa atau bahan latihan lain. Data sintetik boleh membantu meningkatkan prestasi model, termasuk dengan melengkapkan data latihan dalam bidang yang datanya terhad atau tidak seimbang, dan juga boleh menyokong pendekatan pembangunan model yang meningkatkan privasi.
Adakah maklumat peribadi digunakan untuk mengajar ChatGPT?
Sebahagian besar kandungan dalam talian melibatkan maklumat tentang orang, maka data latihan kami mungkin turut mengandungi maklumat peribadi secara tidak sengaja. Namun, kami mengambil langkah untuk mengurangkan pemprosesan maklumat peribadi dalam proses latihan kami.
Kami menggunakan data latihan untuk membangunkan keupayaan model—seperti ramalan, penaakulan dan penyelesaian masalah—bukan untuk membina profil individu, menghubungi mereka atau memperibadikan iklan untuk mereka.
Dalam sesetengah keadaan, model mungkin belajar daripada maklumat peribadi untuk memahami fungsi unsur seperti nama dan alamat dalam bahasa, atau untuk mengenali tokoh awam dan entiti terkenal. Ini membantu model menjana respons yang lebih tepat dan sesuai mengikut konteks.
Bagaimanakah maklumat peribadi dilindungi semasa latihan?
Kami mengambil langkah aktif untuk mengehadkan pemprosesan maklumat peribadi semasa latihan. Sebagai contoh, kami mengecualikan sumber yang diketahui mengagregatkan sejumlah besar data peribadi, menggunakan penapisan untuk mengurangkan maklumat peribadi dalam proses latihan serta mengambil langkah untuk mengenal pasti dan membuang kandungan pendua bagi mengurangkan risiko pengulangan data latihan. Selain itu, kami melatih model kami agar tidak memberikan respons kepada permintaan untuk mendapatkan maklumat peribadi atau sensitif tentang individu.
Tempoh kami menyimpan maklumat
Kami menyimpan maklumat dalam data latihan hanya selama yang semunasabahnya diperlukan bagi tujuan yang diterangkan dalam artikel ini dan Dasar Privasi kami, termasuk untuk membangunkan dan menambah baik model kami serta bagi tujuan penyelidikan saintifik yang berkaitan. Tempoh penyimpanan disemak secara berkala untuk memastikan maklumat masih diperlukan dan berbeza-beza bergantung pada jenis maklumat serta cara maklumat itu digunakan. Dalam menentukan tempoh penyimpanan, kami mempertimbangkan faktor seperti tujuan kami memproses maklumat, jumlah, sifat dan sensitiviti maklumat, potensi risiko kemudaratan akibat penggunaan atau pendedahan tanpa kebenaran serta sebarang kewajipan undang-undang yang terpakai kepada kami.
Bagaimanakah pembangunan ChatGPT mematuhi undang-undang privasi?
Kami menggunakan maklumat latihan secara sah. Model asas kami menguasakan pelbagai aplikasi yang bermanfaat—termasuk alatan kebolehcapaian, sokongan pelanggan, pembangunan perisian, pendidikan diperibadikan dan penyelidikan saintifik. Keupayaan ini bergantung pada data latihan berskala besar, termasuk maklumat yang tersedia secara umum dan maklumat daripada rakan kongsi pihak ketiga. Kami menggunakan langkah perlindungan sepanjang proses latihan, termasuk langkah yang direka bentuk untuk mengurangkan pemprosesan maklumat peribadi dalam proses latihan dan mengurangkan risiko, seperti yang diterangkan dalam artikel ini. Kami mengasaskan pengumpulan dan penggunaan maklumat peribadi yang terkandung dalam maklumat latihan pada kepentingan sah di bawah undang-undang privasi seperti GDPR, termasuk untuk melatih dan menambah baik model kami demi pengguna dan masyarakat secara lebih luas, selaras dengan misi kami untuk memastikan kecerdasan am buatan memberi manfaat kepada semua orang, seperti yang diterangkan dengan lebih terperinci dalam Dasar Privasi kami. Kami telah melengkapkan penilaian kesan perlindungan data bagi membantu memastikan kami mengumpul dan menggunakan maklumat ini secara sah dan bertanggungjawab.
Keadaan maklumat mungkin dikongsi atau dipindahkan
Kami tidak “menjual” maklumat peribadi dan hanya mendedahkan maklumat peribadi dalam data latihan dalam keadaan terhad yang diterangkan dalam Dasar Privasi kami. Sebagai contoh, kami mungkin berkongsi maklumat dengan syarikat sekutu, vendor dan penyedia perkhidmatan yang menyokong pembangunan, pengujian dan penambahbaikan model kami. Kami juga mungkin mendedahkan maklumat berdasarkan kepercayaan suci hati bahawa tindakan tersebut diperlukan untuk mematuhi kewajipan undang-undang atau melindungi hak dan keselamatan kami serta pengguna, pekerja atau orang awam, seperti yang diterangkan dalam Dasar Privasi kami.
Oleh sebab infrastruktur kami bersifat global, maklumat peribadi dalam data latihan mungkin diproses di negara di luar EEA, Switzerland atau UK (termasuk di Amerika Syarikat). Apabila perkara ini berlaku, kami menggunakan langkah perlindungan yang sewajarnya, seperti keputusan kecukupan atau klausa kontrak standard, seperti yang diterangkan dalam Dasar Privasi kami.
Hak anda dan cara melaksanakannya
Kami memberikan respons kepada permintaan bantahan dan permintaan hak lain yang serupa. Hasil daripada pembelajaran bahasa, respons ChatGPT kadangkala mungkin mengandungi maklumat peribadi tentang individu yang maklumat peribadinya muncul berkali-kali di internet awam (contohnya, tokoh awam). Individu dalam bidang kuasa tertentu boleh membantah pemprosesan maklumat peribadi mereka oleh model kami atau membuat permintaan hak subjek data yang lain melalui Portal Privasi kami. Anda juga boleh melaksanakan hak ini dengan menghubungi privacy@openai.com.
Untuk membantu kami menilai dan memberikan respons kepada permintaan anda, sila berikan maklumat yang mencukupi agar kami memahami maklumat peribadi yang berkaitan dengan permintaan anda, seperti nama anda, URL yang berkaitan, contoh khusus output model atau butiran lain yang membantu mengenal pasti isu tersebut. Dalam sesetengah keadaan, kami mungkin meminta anda mengesahkan identiti atau mengesahkan bahawa maklumat tersebut berkaitan dengan anda sebelum kami boleh mengambil tindakan. Maklumat lanjut tentang cara mengemukakan permintaan ini, termasuk amalan terbaik dan cara permintaan disemak, tersedia dalam artikel Pusat Bantuan kami tentang pengalihan keluar data peribadi daripada ChatGPT. Kami menyemak permintaan menurut undang-undang privasi yang terpakai dan memberikan respons dalam tempoh masa yang ditetapkan oleh undang-undang.
Harap maklum bahawa menurut undang-undang privasi, sesetengah hak mungkin bukan hak mutlak. Sebagai contoh, kami mungkin tidak dapat memenuhi permintaan jika kami tidak dapat mengesahkan maklumat yang berkaitan, jika permintaan itu tidak berkaitan dengan maklumat peribadi yang diproses oleh OpenAI, jika pengecualian terpakai atau jika kami mempunyai sebab lain yang sah untuk berbuat demikian. Permintaan dinilai mengikut kes dan mungkin melibatkan pengimbangan hak privasi dengan pertimbangan penting lain, seperti kebebasan bersuara dan kepentingan awam.
Namun, kami berusaha untuk mengutamakan perlindungan maklumat peribadi dan mematuhi semua undang-undang privasi yang terpakai. Jika anda berpendapat bahawa kami belum menangani sesuatu isu dengan secukupnya, anda berhak untuk mengemukakan aduan kepada pihak berkuasa penyeliaan tempatan anda.
Untuk mendapatkan maklumat lanjut tentang amalan OpenAI berkenaan maklumat peribadi yang kami kumpulkan daripada atau tentang anda apabila anda menggunakan laman web, aplikasi dan perkhidmatan kami, sila lihat Dasar Privasi kami.
