OpenAI
Halaman ini diterjemah oleh mesin. Lihat artikel asal dalam bahasa Inggeris.

Cara ChatGPT dan model asas kami dibangunkan

Ketahui lebih lanjut tentang cara kami membangunkan model kami dan menggunakannya dalam produk seperti ChatGPT

Dikemas kini: 9 days ago

Model asas OpenAI, termasuk model yang menguasakan ChatGPT, dibangunkan menggunakan tiga sumber maklumat utama: (1) maklumat yang tersedia secara umum di internet, (2) maklumat yang kami peroleh melalui kerjasama dengan pihak ketiga, dan (3) maklumat yang diberikan atau dijana oleh pengguna, pelatih manusia dan penyelidik kami.

Pembangunan model asas seperti yang digunakan dalam ChatGPT melibatkan beberapa peringkat, termasuk penyediaan data latihan, pralatihan dan pascalatihan, serta penilaian dan penambahbaikan berterusan selepas penggunaan. Jenis maklumat yang berbeza mungkin digunakan pada peringkat ini untuk pelbagai tujuan, termasuk meningkatkan prestasi, kebolehpercayaan dan keselamatan model. 

Artikel ini memberikan gambaran keseluruhan tentang maklumat yang kami gunakan untuk membantu membangunkan model ini, cara kami mengumpul dan menggunakan maklumat tersebut selaras dengan undang-undang privasi, serta langkah perlindungan yang kami gunakan sepanjang proses latihan. Untuk memahami cara kami mengumpul dan menggunakan maklumat daripada pengguna perkhidmatan kami, termasuk cara untuk menarik diri daripada penggunaan perbualan ChatGPT bagi membantu menambah baik model kami, sila lihat Dasar Privasi kami dan artikel pusat bantuan ini.

Apakah ChatGPT dan bagaimanakah ia berfungsi?

ChatGPT ialah perkhidmatan berasaskan kecerdasan buatan yang boleh anda akses melalui internet atau aplikasi. Anda boleh menggunakan ChatGPT untuk pelbagai tugas, termasuk menyusun dan meringkaskan maklumat, membantu terjemahan, menyokong pengekodan, penyelidikan dan analisis, menyelesaikan tugasan berbilang langkah merentas alat, menganalisis atau menjana imej, mencetuskan kreativiti dan idea, serta aktiviti harian lain. ChatGPT direka bentuk untuk memahami dan menjawab soalan serta arahan pengguna dengan mempelajari corak daripada sejumlah besar maklumat, termasuk teks, imej, audio dan video. 

Semasa latihan, model menganalisis hubungan dalam data ini—seperti cara perkataan lazimnya muncul bersama dalam konteks—dan menggunakan pemahaman itu untuk meramalkan perkataan seterusnya yang paling mungkin apabila menjana respons, satu perkataan pada satu masa. Teks boleh ditukar kepada unit yang lebih kecil, kadangkala dipanggil “token”, yang mungkin mewakili perkataan penuh, bahagian perkataan atau tanda baca. Token ialah blok binaan teks yang diproses oleh model. Begitu juga, model yang menjana bentuk kandungan lain, seperti imej, mempelajari corak tentang cara piksel saling berkaitan dan bagaimana ia berkaitan dengan kapsyen yang dikaitkan dalam data latihan.

Contohnya, semasa proses pembelajaran model (dikenali sebagai “latihan”), model mungkin diberi tugas untuk melengkapkan ayat seperti: “Daripada membelok ke kiri, dia membelok ___.” Pada peringkat awal latihan, responsnya kebanyakannya rawak. Namun, apabila model memproses dan belajar daripada jumlah teks yang besar, ia menjadi lebih baik dalam mengenal pasti corak dan meramalkan perkataan seterusnya yang paling mungkin. Proses ini diulang merentas jutaan ayat untuk memperhalus pemahamannya dan meningkatkan ketepatannya.

Oleh sebab terdapat beberapa cara yang munasabah untuk melengkapkan ayat—seperti “Daripada membelok ke kiri, dia membelok ke kanan,” “berpusing,” atau “berundur”—terdapat unsur kerawakan yang sememangnya wujud dalam cara model memberikan respons. Akibatnya, soalan yang sama mungkin menghasilkan jawapan yang berbeza dalam pertanyaan yang berbeza.

Model pembelajaran mesin terdiri daripada set nombor yang besar, dikenali sebagai “pemberat” atau “parameter”, bersama-sama kod yang mentafsir dan menggunakan nombor tersebut. Model ini tidak menyimpan atau mengekalkan salinan data yang digunakan untuk melatihnya. Sebaliknya, apabila model belajar, nilai parameternya dilaraskan sedikit untuk mencerminkan corak yang telah dikenal pastinya. Dalam contoh awal tadi, model bertambah baik daripada meramalkan perkataan secara rawak kepada membuat ramalan yang lebih tepat—bukan dengan menyimpan ayat latihan, tetapi dengan mengemas kini parameter dalamannya. Model tidak mengekalkan salinan ayat, imej atau audio yang diprosesnya semasa latihan. ChatGPT tidak “menyalin dan menampal” daripada data latihannya—sama seperti seorang guru yang, selepas banyak belajar, boleh menerangkan konsep dengan memahami hubungan antara idea tanpa menghafal atau menghasilkan semula bahan asal secara kata demi kata. Apabila menjana respons kepada permintaan pengguna, model menggunakan pemberat yang telah dipelajari ini untuk meramalkan dan mencipta kandungan baharu.

Apakah jenis maklumat yang digunakan untuk mengajar ChatGPT?

Bagi kandungan internet yang tersedia secara umum, kami hanya menggunakan maklumat yang boleh diakses secara bebas dan terbuka di internet. Ini mungkin termasuk halaman web yang tersedia secara umum, forum awam, blog awam, hantaran awam dan kandungan dalam talian lain yang tersedia secara umum. Contohnya, jika anda menyertai forum perbincangan dalam talian yang tersedia secara umum atau menerbitkan blog awam atau hantaran lain yang bersifat awam, kami mungkin menggunakan kandungan yang boleh diakses umum itu untuk tujuan latihan model. Walau bagaimanapun, kami mengambil langkah untuk mengurangkan pemprosesan maklumat peribadi dalam proses latihan kami.  Apabila mengumpul kandungan internet yang tersedia secara umum, kami tidak dengan sengaja mengumpulkan data daripada sumber yang diketahui berada di sebalik paywall atau daripada dark web. Selain itu, kami menggunakan penapis untuk membuang bahan yang kami tidak mahu model kami pelajari, seperti ucapan kebencian, kandungan dewasa, laman yang mengagregatkan maklumat peribadi dan spam. Maklumat yang selebihnya kemudian digunakan untuk melatih model kami. 

Pemilik laman web boleh mengurus sama ada kandungan yang tersedia secara umum daripada laman mereka boleh diakses untuk digunakan dalam latihan dengan menggunakan kawalan web standard seperti robots.txt untuk tidak membenarkan GPTBot, yang mungkin merayap kandungan yang tersedia secara umum bagi membantu melatih model kami. Kami menyediakan panduan untuk membantu pemilik laman web mengurus cara laman dan kandungan mereka berinteraksi dengan sistem AI kami. 

Kami juga menggunakan maklumat daripada rakan kongsi pihak ketiga untuk membantu melatih dan menambah baik model kami. Ini mungkin termasuk maklumat dalam set data yang kami akses melalui perjanjian dengan pihak ketiga, serta maklumat yang diberikan atau dijana oleh pelatih manusia dan penyelidik apabila dibenarkan di bawah dasar dan perjanjian kami. Ini membantu meningkatkan kualiti, keselamatan dan prestasi model kami. Sumber ini mungkin merangkumi teks, imej, audio, video atau jenis data lain, bergantung pada set data.

Kami juga semakin banyak menggunakan data sintetik dalam sesetengah proses latihan. Contohnya, kami mungkin menggunakan maklumat dan model kami untuk menjana gesaan sintetik, contoh berbilang bahasa atau bahan latihan lain. Data sintetik boleh membantu meningkatkan prestasi model, termasuk dengan melengkapkan data latihan dalam bidang yang datanya terhad atau tidak seimbang, dan juga boleh menyokong pendekatan pembangunan model yang meningkatkan privasi.

Adakah maklumat peribadi digunakan untuk mengajar ChatGPT?

Sebahagian besar kandungan dalam talian melibatkan maklumat tentang orang, jadi data latihan kami mungkin secara tidak sengaja merangkumi maklumat peribadi. Walau bagaimanapun, kami mengambil langkah untuk mengurangkan pemprosesan maklumat peribadi dalam proses latihan kami.

Kami menggunakan data latihan untuk membangunkan keupayaan model—seperti ramalan, penaakulan dan penyelesaian masalah—bukan untuk membina profil individu, menghubungi mereka atau memperibadikan iklan untuk mereka.

Dalam sesetengah kes, model mungkin belajar daripada maklumat peribadi untuk memahami cara elemen seperti nama dan alamat berfungsi dalam bahasa, atau untuk mengenal pasti tokoh awam dan entiti terkenal. Ini membantu model menjana respons yang lebih tepat dan sesuai dengan konteks.

Bagaimanakah maklumat peribadi dilindungi semasa latihan?

Kami mengambil langkah aktif untuk mengehadkan pemprosesan maklumat peribadi semasa latihan. Contohnya, kami mengecualikan sumber yang diketahui mengagregatkan sejumlah besar data peribadi, menggunakan penapisan untuk mengurangkan maklumat peribadi dalam proses latihan, dan mengambil langkah untuk mengenal pasti serta membuang kandungan pendua bagi mengurangkan risiko data latihan diulang. Selain itu, kami melatih model kami supaya mengelak daripada menjawab permintaan untuk maklumat peribadi atau sensitif tentang individu. 

Tempoh kami menyimpan maklumat

Kami menyimpan maklumat dalam data latihan hanya selama yang semunasabahnya perlu bagi tujuan yang diterangkan dalam artikel ini dan Dasar Privasi kami, termasuk untuk membangunkan dan menambah baik model kami serta untuk tujuan penyelidikan saintifik yang berkaitan. Penyimpanan tertakluk pada semakan berkala untuk memastikan keperluannya berterusan, dan berbeza-beza bergantung pada jenis maklumat serta cara ia digunakan. Dalam menentukan penyimpanan, kami mempertimbangkan faktor seperti tujuan kami memproses maklumat, jumlah, sifat dan sensitiviti maklumat, potensi risiko mudarat akibat penggunaan atau pendedahan tanpa kebenaran, serta sebarang kewajipan undang-undang yang terpakai kepada kami.

Bagaimanakah pembangunan ChatGPT mematuhi undang-undang privasi?

Kami menggunakan maklumat latihan secara sah. Model asas kami menguasakan pelbagai aplikasi yang bermanfaat—termasuk alat kebolehcapaian, sokongan pelanggan, pembangunan perisian, pendidikan diperibadikan dan penyelidikan saintifik. Keupayaan ini bergantung pada data latihan berskala besar, termasuk maklumat yang tersedia secara umum dan maklumat daripada rakan kongsi pihak ketiga. Kami menggunakan langkah perlindungan sepanjang proses latihan, termasuk langkah yang direka untuk mengurangkan pemprosesan maklumat peribadi dalam proses latihan dan mengurangkan risiko, seperti yang diterangkan dalam artikel ini. Kami mendasarkan pengumpulan dan penggunaan maklumat peribadi yang termasuk dalam maklumat latihan pada kepentingan sah di bawah undang-undang privasi seperti GDPR, termasuk untuk melatih dan menambah baik model kami bagi pengguna dan masyarakat yang lebih luas selaras dengan misi kami untuk memastikan kecerdasan am buatan memberi manfaat kepada semua orang, seperti yang dijelaskan dengan lebih terperinci dalam Dasar Privasi kami. Kami telah melengkapkan penilaian impak perlindungan data untuk membantu memastikan kami mengumpul dan menggunakan maklumat ini secara sah dan bertanggungjawab.

Apabila maklumat mungkin dikongsi atau dipindahkan

Kami tidak “menjual” maklumat peribadi, dan hanya mendedahkan maklumat peribadi dalam data latihan dalam keadaan terhad yang diterangkan dalam Dasar Privasi kami. Contohnya, kami mungkin berkongsi maklumat dengan ahli gabungan, vendor dan penyedia perkhidmatan yang menyokong pembangunan, pengujian dan penambahbaikan model kami. Kami juga mungkin mendedahkan maklumat dengan kepercayaan suci hati bahawa tindakan sedemikian perlu untuk mematuhi kewajipan undang-undang atau untuk melindungi hak, keselamatan dan sekuriti kami serta hak, keselamatan dan sekuriti pengguna, pekerja atau orang awam, seperti yang diterangkan dalam Dasar Privasi kami.

Memandangkan infrastruktur kami bersifat global, maklumat peribadi dalam data latihan mungkin diproses di negara di luar EEA, Switzerland atau UK (termasuk di Amerika Syarikat). Apabila ini berlaku, kami menggunakan langkah perlindungan yang sesuai, seperti keputusan kecukupan atau klausa kontrak standard, seperti yang diterangkan dalam Dasar Privasi kami.

Hak anda dan cara melaksanakannya

Kami memberi respons kepada permintaan bantahan dan permintaan hak yang serupa. Hasil daripada pembelajaran bahasa, respons ChatGPT kadangkala mungkin merangkumi maklumat peribadi tentang individu yang maklumat peribadinya muncul berulang kali di internet awam (contohnya, tokoh awam). Individu di bidang kuasa tertentu boleh membantah pemprosesan maklumat peribadi mereka oleh model kami atau membuat permintaan hak subjek data lain melalui Portal Privasi kami. Anda juga boleh melaksanakan hak ini dengan menghubungi privacy@openai.com

Untuk membantu kami menilai dan menjawab permintaan anda, sila berikan maklumat yang mencukupi supaya kami dapat memahami maklumat peribadi yang berkaitan dengan permintaan anda, seperti nama anda, URL yang berkaitan, contoh khusus output model atau butiran lain yang membantu mengenal pasti isu tersebut. Dalam sesetengah kes, kami mungkin meminta anda mengesahkan identiti anda atau mengesahkan bahawa maklumat tersebut berkaitan dengan anda sebelum kami boleh mengambil tindakan. Maklumat lanjut tentang cara menyerahkan permintaan ini, termasuk amalan terbaik dan cara permintaan disemak, tersedia dalam artikel Pusat Bantuan kami tentang pengalihan keluar data peribadi daripada ChatGPT. Kami menyemak permintaan mengikut undang-undang privasi yang terpakai dan memberi respons dalam tempoh masa undang-undang yang terpakai.

Sila ambil perhatian bahawa, mengikut undang-undang privasi, sesetengah hak mungkin tidak mutlak. Contohnya, kami mungkin tidak dapat memenuhi permintaan jika kami tidak dapat mengesahkan maklumat yang berkaitan, jika permintaan itu tidak berkaitan dengan maklumat peribadi yang diproses oleh OpenAI, jika pengecualian terpakai, atau jika kami mempunyai sebab sah lain untuk berbuat demikian. Permintaan dinilai berdasarkan kes demi kes dan mungkin melibatkan pengimbangan hak privasi dengan pertimbangan penting lain, seperti kebebasan bersuara dan kepentingan awam. 

Walau bagaimanapun, kami berusaha untuk mengutamakan perlindungan maklumat peribadi dan mematuhi semua undang-undang privasi yang terpakai. Jika anda merasakan kami belum menangani sesuatu isu dengan secukupnya, anda berhak membuat aduan kepada pihak berkuasa penyeliaan tempatan anda.

Untuk maklumat lanjut tentang amalan OpenAI berkenaan maklumat peribadi yang kami kumpulkan daripada atau tentang anda apabila anda menggunakan laman web, aplikasi dan perkhidmatan kami, sila lihat Dasar Privasi kami.

Adakah artikel ini membantu?