OpenAI
Kaca iki diterjemahake nganggo mesin. Deleng artikel asli basa Inggris.

Cara ChatGPT lan model foundation kami dikembangaké

Sinau luwih akèh babagan cara kami ngembangaké model lan nggunakaké ing produk kaya ChatGPT

Pembaruan: 7 days ago

Model dhasar OpenAI, kalebu model sing nguwasani ChatGPT, dikembangake nganggo telung sumber informasi utama: (1) informasi sing kasedhiya kanggo umum ing internet, (2) informasi sing bisa diakses liwat kerja sama karo pihak katelu, lan (3) informasi sing diwenehake utawa digawe dening panganggo, pelatih manungsa, lan panaliti kita.

Pangembangan model dhasar kaya sing digunakake ing ChatGPT ngliwati sawetara tahap, kalebu nyiapake data latihan, latihan awalan, lan latihan sawisé iku, uga evaluasi lan panyampurnan terus-terusan sawisé diluncurake. Manéka jinis informasi bisa digunakake ing tahap-tahap kasebut kanggo macem-macem tujuan, kalebu ningkatake kinerja, linuwih, lan keamanan model. 

Artikel iki menehi ringkesan babagan informasi sing digunakake kanggo mbantu ngembangake model-model iki, cara kita nglumpukake lan nggunakake informasi kasebut kanthi manut hukum privasi, lan pangayoman sing ditrapake ing saindhenging proses latihan. Kanggo mangerteni cara kita nglumpukake lan nggunakake informasi saka panganggo layanan, kalebu cara milih supaya pacelathon ChatGPT ora digunakake kanggo mbantu nyampurnakake model kita, wacanen kebijakan privasi lan artikel Pusat Bantuan iki.

Apa iku ChatGPT lan kepriyé cara kerjane?

ChatGPT iku layanan adhedhasar kacerdhasan tiruan sing bisa diakses liwat internet utawa aplikasi. Sampeyan bisa nggunakake ChatGPT kanggo manéka tugas, kalebu nata lan ngringkes informasi, mbantu nerjemahake, ndhukung pamrograman, riset lan analisis, ngrampungake tugas kanthi pirang-pirang langkah ing manéka piranti, nganalisis utawa nggawe gambar, nuwuhake kreativitas lan gagasan, lan kagiyatan saben dina liyane. ChatGPT dirancang supaya bisa mangerteni lan nanggapi pitakon sarta prentah panganggo kanthi sinau pola saka informasi sing akèh, kalebu teks, gambar, audio, lan video. 

Sajrone latihan, model nganalisis sesambungan ing data iki—kayata carane tembung lumrahé katon bebarengan miturut konteks—banjur nggunakake pangerten kasebut kanggo ngramal tembung sabanjuré sing paling mungkin nalika nggawe wangsulan, siji mbaka siji. Teks bisa diowahi dadi unit sing luwih cilik, kadhang disebut “token”, sing bisa makili tembung wutuh, pérangan tembung, utawa tandha wacan. Token minangka unsur panyusun teks sing diproses dening model. Semono uga, model sing nggawe wujud kontèn liyane, kayata gambar, sinau pola sesambungan antarpiksel lan sesambungane karo katrangan gambar ing data latihan.

Contoné, sajrone proses sinau model (sing diarani “latihan”), model bisa diwènèhi tugas kanggo njangkepi ukara kaya mangkéné: “Tinimbang ménggok ngiwa, dhèwèké malah ménggok ___.” Ing wiwitan latihan, wangsulane isih umumé acak. Nanging, saya akèh teks sing diproses lan disinaoni model, saya apik model kasebut ngenali pola lan ngramal tembung sabanjuré sing paling mungkin. Proses iki dibalèni ing mayuta-yuta ukara kanggo ngasah pangerten lan ningkatake akurasiné.

Amarga ana sawetara cara sing padha-padha mlebu nalar kanggo njangkepi ukara—kayata “Tinimbang ménggok ngiwa, dhèwèké malah ménggok nengen,” “mbalik,” utawa “mundur”—wangsulan model pancèn ngandhut unsur acak. Mula, pitakon sing padha bisa ngasilake wangsulan sing béda nalika ditakokake kaping pirang-pirang.

Model pambelajaran mesin kasusun saka kumpulan angka sing gedhé, sing dikenal minangka “bobot” utawa “paramèter”, lan kode sing napsirake lan nggunakake angka kasebut. Model-model iki ora nyimpen utawa nahan salinan data sing digunakake kanggo nglatih. Nanging, nalika model sinau, angka paramèteré diowahi sithik kanggo nggambarake pola sing wis dingertèni. Ing conto sadurungé, model saya apik, saka ngramal tembung kanthi acak dadi luwih akurat—dudu amarga nyimpen ukara latihan, nanging amarga nganyari paramèter internalé. Model ora nahan salinan ukara, gambar, utawa audio sing diproses sajrone latihan. ChatGPT ora “nyalin lan nèmpèl” saka data latihan—padha kaya guru sing, sawisé sinau kanthi jero, bisa njlentrehake konsep kanthi mangerteni sesambungan antargagasan tanpa ngapalake utawa ngasilake manèh bahan asliné persis tembung demi tembung. Nalika nggawe wangsulan kanggo panjaluk panganggo, model nggunakake bobot sing wis disinaoni iki kanggo ngramal lan nggawe kontèn anyar.

Jinis informasi apa sing digunakake kanggo mulang ChatGPT?

Kanggo kontèn internet sing kasedhiya kanggo umum, kita mung nggunakake informasi sing bisa diakses kanthi bébas lan tinarbuka ing internet. Iki bisa kalebu kaca web umum, forum umum, blog umum, kiriman umum, lan kontèn online liyane sing kasedhiya kanggo umum. Contoné, yen sampeyan mèlu forum diskusi online sing mbukak kanggo umum utawa nerbitake blog utawa kiriman umum liyane, kita bisa nggunakake kontèn sing bisa diakses umum kasebut kanggo latihan model. Nanging, kita nindakake langkah-langkah kanggo nyuda pangolahan informasi pribadhi sajrone proses latihan.  Nalika nglumpukake kontèn internet sing kasedhiya kanggo umum, kita ora kanthi sengaja njupuk data saka sumber sing dingertèni mbutuhake pambayaran utawa saka dark web. Kajaba iku, kita ngetrapake panyaring kanggo mbusak materi sing ora dikarepaké disinaoni model, kayata ujaran sengit, kontèn diwasa, situs sing nglumpukake informasi pribadhi, lan spam. Informasi sing isih kari banjur digunakake kanggo nglatih model kita. 

Pamilik situs web bisa ngatur apa kontèn umum saka situsé bisa diakses kanggo latihan nganggo kontrol web baku kaya robots.txt kanggo ngalangi GPTBot, sing bisa njelajah kontèn umum kanggo mbantu nglatih model kita. Kita nyedhiyakake pandhuan kanggo mbantu pamilik situs web ngatur interaksi situs lan kontèné karo sistem AI kita. 

Kita uga nggunakake informasi saka mitra pihak katelu kanggo mbantu nglatih lan nyampurnakake model kita. Iki bisa kalebu informasi ing set data sing bisa diakses liwat prajanjèn karo pihak katelu, uga informasi sing diwenehake utawa digawe dening pelatih manungsa lan panaliti, manawa diidinake miturut kabijakan lan prajanjèn kita. Iki mbantu ningkatake mutu, keamanan, lan kinerja model kita. Gumantung marang set datané, sumber kasebut bisa ngemot teks, gambar, audio, video, utawa jinis data liyane.

Kita uga saya kerep nggunakake data sintetis ing sawetara proses latihan. Contoné, kita bisa nggunakake informasi lan model kita kanggo nggawe pituduh sintetis, conto multibasa, utawa bahan latihan liyane. Data sintetis bisa mbantu ningkatake kinerja model, kalebu kanthi nambahi data latihan ing babagan sing datané winates utawa ora imbang, lan uga bisa ndhukung cara pangembangan model sing luwih ngreksa privasi.

Apa informasi pribadhi digunakake kanggo mulang ChatGPT?

Akèh kontèn online ngemot informasi babagan wong, mula data latihan kita bisa waé tanpa disengaja ngemot informasi pribadhi. Nanging, kita nindakake langkah-langkah kanggo nyuda pangolahan informasi pribadhi sajrone proses latihan.

Kita nggunakake data latihan kanggo ngembangake kabisan model—kayata prédhiksi, nalar, lan ngrampungake masalah—dudu kanggo nggawe profil wong, ngubungi, utawa nyetel iklan khusus kanggo wong kasebut.

Ing sawetara kasus, model bisa sinau saka informasi pribadhi kanggo mangerteni fungsi unsur kaya jeneng lan alamat ing basa, utawa kanggo ngenali tokoh umum lan èntitas sing kondhang. Iki mbantu model nggawe wangsulan sing luwih akurat lan cocog karo konteks.

Kepriyé informasi pribadhi direksa sajrone latihan?

Kita aktif nindakake langkah-langkah kanggo matesi pangolahan informasi pribadhi sajrone latihan. Contoné, kita ora nglebokake sumber sing dingertèni nglumpukake akèh data pribadhi, ngetrapake panyaring kanggo nyuda informasi pribadhi ing proses latihan, lan ngenali sarta mbusak kontèn duplikat kanggo nyuda risiko data latihan diambali. Kajaba iku, kita nglatih model supaya ora nanggapi panjaluk informasi pribadi utawa sensitif babagan wong. 

Suwéné kita nyimpen informasi

Kita mung nyimpen informasi ing data latihan sajrone wektu sing lumrahé dibutuhake kanggo tujuan sing dijlentrehake ing artikel iki lan kebijakan privasi kita, kalebu kanggo ngembangake lan nyampurnakake model sarta kanggo riset ilmiah sing gegandhèngan. Panyimpenan ditinjau kanthi rutin kanggo mesthekake isih dibutuhake, lan suwéné gumantung marang jinis informasi lan cara panganggoné. Nalika nemtokake suwéné panyimpenan, kita nimbang faktor kayata tujuan ngolah informasi, gunggung, sipat, lan sensitivitas informasi, potènsi risiko karusakan amarga panggunaan utawa pambocoran tanpa idin, lan kewajiban hukum sing kudu kita tindakake.

Kepriyé pangembangan ChatGPT manut hukum privasi?

Kita nggunakake informasi latihan kanthi sah. Model dhasar kita nguwasani manéka aplikasi sing migunani—kalebu piranti aksesibilitas, dhukungan pelanggan, pangembangan piranti lunak, pendhidhikan sing dipersonalisasi, lan riset ilmiah. Kabisan kasebut gumantung marang data latihan skala gedhé, kalebu informasi sing kasedhiya kanggo umum lan informasi saka mitra pihak katelu. Kita ngetrapake pangayoman ing saindhenging proses latihan, kalebu langkah kanggo nyuda pangolahan informasi pribadhi lan nyilikake risiko, kaya sing dijlentrehake ing artikel iki. Kita nglumpukake lan nggunakake informasi pribadhi sing kalebu ing informasi latihan adhedhasar kapentingan sing sah miturut hukum privasi kaya GDPR, kalebu kanggo nglatih lan nyampurnakake model kanggo panganggo lan masyarakat umum, selaras karo misi kita kanggo mesthekake kecerdhasan umum tiruan migunani tumrap kabèh wong, kaya sing dijlentrehake luwih rinci ing kebijakan privasi kita. Kita wis ngrampungake pambiji dampak pangayoman data kanggo mbantu mesthekake informasi iki diklumpukake lan digunakake kanthi sah lan tanggung jawab.

Nalika informasi bisa dibagekake utawa ditransfer

Kita ora “ngedol” informasi pribadhi, lan mung mbabarake informasi pribadhi ing data latihan ing kahanan winates sing dijlentrehake ing kebijakan privasi kita. Contoné, kita bisa nuduhake informasi marang afiliasi, vendor, lan panyedhiya layanan sing ndhukung pangembangan, pangujian, lan panyampurnan model kita. Kita uga bisa mbabarake informasi kanthi niat apik yen tumindak kasebut dipercaya perlu kanggo netepi kewajiban hukum utawa ngreksa hak, kaslametan, lan keamanan kita uga panganggo, karyawan, utawa masyarakat, kaya sing dijlentrehake ing kebijakan privasi kita.

Amarga prasarana kita sipaté global, informasi pribadhi ing data latihan bisa diproses ing negara njaba EEA, Swiss, utawa Britania Raya (kalebu ing Amerika Serikat). Yen iki kedadéan, kita ngetrapake pangayoman sing cocog, kayata putusan kacukupan utawa klausul kontrak baku, kaya sing dijlentrehake ing kebijakan privasi kita.

Hak sampeyan lan cara nggunakake

Kita nanggapi panjaluk kabotan lan panjaluk hak liyane sing padha. Minangka asil saka sinau basa, wangsulan ChatGPT kadhang bisa ngemot informasi pribadhi babagan wong sing informasi pribadhiné muncul bola-bali ing internet umum (contone, tokoh umum). Wong ing yurisdiksi tartamtu bisa ngajokake kabotan marang pangolahan informasi pribadhiné dening model kita utawa ngajokake panjaluk hak subjek data liyane liwat Portal Privasi kita. Sampeyan uga bisa nggunakake hak kasebut kanthi ngubungi privacy@openai.com.

Kanggo mbantu kita mbiji lan nanggapi panjaluk sampeyan, wènèhana informasi sing cukup supaya kita mangerteni informasi pribadhi sing dimaksud, kayata jeneng, URL sing cocog, conto tartamtu saka output model, utawa katrangan liya sing mbantu ngenali masalah kasebut. Ing sawetara kasus, kita bisa njaluk sampeyan verifikasi idhèntitas utawa ngonfirmasi manawa informasi kasebut gegayutan karo sampeyan sadurungé kita bisa tumindak. Informasi luwih akèh babagan cara ngajokake panjaluk iki, kalebu praktik paling apik lan cara panjaluk ditinjau, kasedhiya ing artikel Pusat Bantuan babagan pambusakan data pribadhi saka ChatGPT. Kita mriksa panjaluk miturut hukum privasi sing lumaku lan nanggapi sajrone wates wektu sing ditemtokake hukum.

Élinga manawa, miturut hukum privasi, sawetara hak bisa uga ora mutlak. Contoné, kita bisa uga ora bisa netepi panjaluk yen ora bisa verifikasi informasi sing cocog, panjaluk ora gegayutan karo informasi pribadhi sing diproses OpenAI, ana pangecualian sing lumaku, utawa ana alesan sah liyane. Saben panjaluk dibiji miturut kasusé lan bisa mbutuhake panyimbangan antarané hak privasi lan prakara penting liyane, kayata kabébasan mratélakake panemu lan kapentingan umum.

Nanging, kita ngupaya ngutamakake pangayoman informasi pribadhi lan netepi kabèh hukum privasi sing lumaku. Yen sampeyan rumangsa masalah durung ditangani kanthi nyukupi, sampeyan nduwé hak ngajokake keluhan marang panguwasa pengawas ing wilayah sampeyan.

Kanggo informasi luwih akèh babagan praktik OpenAI tumrap informasi pribadhi sing diklumpukake saka utawa babagan sampeyan nalika nggunakake situs web, aplikasi, lan layanan kita, wacanen kebijakan privasi kita.

Apa artikel iki migunani kanggo sampeyan?