OpenAI
Ang page na ito ay isinalin ng AI. Tingnan ang orihinal na artikulo sa English.

Paano binubuo ang ChatGPT at ang aming mga foundation model

Matuto pa tungkol sa kung paano namin binubuo ang aming mga modelo at ginagamit ang mga ito sa mga produktong tulad ng ChatGPT

Na-update: 3 days ago

Ang mga foundation model ng OpenAI, kabilang ang mga modelong nagpapatakbo sa ChatGPT, ay binubuo gamit ang tatlong pangunahing pinagmumulan ng impormasyon: (1) impormasyong pampublikong makukuha sa internet, (2) impormasyong ina-access namin sa pakikipagtulungan sa mga third party, at (3) impormasyong ibinibigay o ginagawa ng aming mga user, human trainer, at researcher.

May ilang yugto ang pagbuo ng mga foundation model gaya ng ginagamit sa ChatGPT, kabilang ang paghahanda ng training data, pre-training, at post-training, pati ang patuloy na pagsusuri at pagpapahusay pagkatapos i-deploy. Maaaring gumamit ng iba't ibang uri ng impormasyon sa mga yugtong ito para sa iba't ibang layunin, kabilang ang pagpapahusay sa performance, pagiging maaasahan, at kaligtasan ng modelo. 

Nagbibigay ang artikulong ito ng pangkalahatang-ideya ng impormasyong ginagamit namin upang makatulong sa pagbuo ng mga modelong ito, kung paano namin kinokolekta at ginagamit ang impormasyong iyon alinsunod sa mga batas sa privacy, at ang mga proteksiyong ipinapatupad namin sa buong proseso ng pagsasanay. Upang maunawaan kung paano namin kinokolekta at ginagamit ang impormasyon mula sa mga user ng aming mga serbisyo, kabilang ang paraan para hindi isama ang mga pag-uusap sa ChatGPT sa pagpapahusay ng aming mga modelo, pakitingnan ang aming patakaran sa privacy at artikulong ito sa Help Center.

Ano ang ChatGPT at paano ito gumagana?

Ang ChatGPT ay isang serbisyong gumagamit ng artificial intelligence na maa-access mo sa internet o app. Magagamit mo ang ChatGPT sa maraming gawain, kabilang ang pag-aayos at pagbubuod ng impormasyon, pagtulong sa pagsasalin, coding, pananaliksik at pagsusuri, pagkumpleto ng mga gawaing may maraming hakbang gamit ang iba't ibang tool, pagsusuri o pagbuo ng mga larawan, pagbibigay-inspirasyon sa pagkamalikhain at mga ideya, at iba pang pang-araw-araw na aktibidad. Dinisenyo ang ChatGPT upang maunawaan at masagot ang mga tanong at tagubilin ng user sa pamamagitan ng pagkatuto ng mga pattern mula sa napakaraming impormasyon, kabilang ang text, larawan, audio, at video. 

Habang sinasanay, sinusuri ng modelo ang mga ugnayan sa data na ito—gaya ng karaniwang pagsasama-sama ng mga salita ayon sa konteksto—at ginagamit ang pagkaunawang iyon upang hulaan ang pinakamalamang na susunod na salita habang bumubuo ng sagot, paisa-isang salita. Maaaring hatiin ang text sa mas maliliit na unit, na kung minsan ay tinatawag na “mga token,” na maaaring kumatawan sa buong salita, bahagi ng salita, o bantas. Ang mga token ang mga pangunahing yunit ng text na pinoproseso ng modelo. Gayundin, natututo ang mga modelong bumubuo ng ibang uri ng content, gaya ng mga larawan, mula sa mga pattern ng ugnayan ng mga pixel sa isa't isa at sa kaugnay na mga caption sa training data.

Halimbawa, habang natututo ang modelo (prosesong tinatawag na “pagsasanay”), maaaring ipakompleto rito ang pangungusap na: “Instead of turning left, she turned ___.” Sa simula ng pagsasanay, halos random ang mga sagot nito. Gayunman, habang pinoproseso at pinag-aaralan ng modelo ang napakaraming text, mas mahusay nitong nakikilala ang mga pattern at nahuhulaan ang pinakamalamang na susunod na salita. Inuulit ang prosesong ito sa milyon-milyong pangungusap upang pinuhin ang pagkaunawa ng modelo at pahusayin ang katumpakan nito.

Dahil maraming posibleng tamang paraan upang kumpletuhin ang isang pangungusap—gaya ng “Instead of turning left, she turned right,” “around,” o “back”—likas na may bahagyang randomness sa pagsagot ng modelo. Dahil dito, maaaring magbunga ng magkakaibang sagot ang iisang tanong kapag ilang beses itong itinanong.

Binubuo ang mga machine learning model ng malalaking hanay ng mga numero, na tinatawag na “weights” o “parameters,” kasama ang code na nagbibigay-kahulugan at gumagamit sa mga numerong iyon. Hindi nag-iimbak o nagpapanatili ang mga modelong ito ng mga kopya ng data na ginamit sa pagsasanay sa mga ito. Sa halip, habang natututo ang isang modelo, bahagyang inaayos ang mga value ng mga parameter nito upang ipakita ang mga pattern na natukoy nito. Sa naunang halimbawa, umunlad ang modelo mula sa paghula ng mga random na salita tungo sa paggawa ng mas tumpak na hula—hindi sa pag-iimbak ng mga pangungusap sa pagsasanay, kundi sa pag-update ng mga internal na parameter nito. Hindi nagpapanatili ang modelo ng mga kopya ng mga pangungusap, larawan, o audio na pinoproseso nito habang sinasanay. Hindi “kinokopya at pine-paste” ng ChatGPT ang training data nito—katulad ng isang gurong, matapos mag-aral nang husto, ay nakapagpapaliwanag ng mga konsepto dahil nauunawaan niya ang ugnayan ng mga ideya nang hindi isinasaulo o eksaktong inuulit ang orihinal na materyal. Kapag bumubuo ng sagot sa kahilingan ng user, ginagamit ng modelo ang mga natutuhan nitong weight upang hulaan at lumikha ng bagong content.

Anong uri ng impormasyon ang ginagamit upang turuan ang ChatGPT?

Para sa content sa internet na pampublikong makukuha, ginagamit lamang namin ang impormasyong libre at bukas na maa-access sa internet. Maaaring kabilang dito ang mga webpage, forum, blog, post, at iba pang online na content na pampublikong makukuha. Halimbawa, kung sasali ka sa isang pampublikong online discussion forum o maglalathala ng pampublikong blog o iba pang post, maaari naming gamitin ang pampublikong naa-access na content na iyon sa pagsasanay ng modelo. Gayunman, gumagawa kami ng mga hakbang upang mabawasan ang pagproseso ng personal na impormasyon sa proseso ng pagsasanay.  Kapag kumokolekta ng pampublikong content sa internet, hindi namin sinasadyang kumuha ng data mula sa mga source na alam naming nasa likod ng mga paywall o mula sa dark web. Bukod dito, gumagamit kami ng mga filter upang alisin ang materyal na ayaw naming matutuhan ng aming mga modelo, gaya ng hate speech, pang-adultong content, mga site na nagtitipon ng personal na impormasyon, at spam. Pagkatapos, ginagamit ang natitirang impormasyon upang sanayin ang aming mga modelo. 

Makokontrol ng mga may-ari ng website kung maa-access ang pampublikong content mula sa kanilang mga site para gamitin sa pagsasanay sa pamamagitan ng mga karaniwang web control, gaya ng robots.txt, upang pagbawalan ang GPTBot, na maaaring mag-crawl ng pampublikong content para makatulong sa pagsasanay ng aming mga modelo. Nagbibigay kami ng gabay upang matulungan ang mga may-ari ng website na pamahalaan kung paano nakikipag-ugnayan ang kanilang mga site at content sa aming mga AI system. 

Gumagamit din kami ng impormasyon mula sa mga third-party partner upang makatulong na sanayin at pahusayin ang aming mga modelo. Maaaring kabilang dito ang impormasyon sa mga dataset na naa-access namin sa pamamagitan ng mga kasunduan sa mga third party, pati ang impormasyong ibinibigay o ginagawa ng mga human trainer at researcher kung pinahihintulutan ng aming mga patakaran at kasunduan. Nakakatulong ito na pahusayin ang kalidad, kaligtasan, at performance ng aming mga modelo. Maaaring kabilang sa mga source na ito ang text, larawan, audio, video, o iba pang uri ng data, depende sa dataset.

Mas ginagamit na rin namin ang synthetic data sa ilang proseso ng pagsasanay. Halimbawa, maaari kaming gumamit ng impormasyon at ng aming mga modelo upang bumuo ng mga synthetic prompt, halimbawa sa iba't ibang wika, o iba pang materyal sa pagsasanay. Makakatulong ang synthetic data na pahusayin ang performance ng modelo, kabilang ang pagdaragdag sa training data sa mga larangang kakaunti o hindi balanse ang data, at maaari din nitong suportahan ang mga paraang nagpapahusay sa privacy sa pagbuo ng modelo.

Ginagamit ba ang personal na impormasyon upang turuan ang ChatGPT?

Malaking bahagi ng online na content ang may kinalaman sa impormasyon tungkol sa mga tao, kaya maaaring hindi sinasadyang mapasama ang personal na impormasyon sa aming training data. Gayunman, gumagawa kami ng mga hakbang upang mabawasan ang pagproseso ng personal na impormasyon sa proseso ng pagsasanay.

Ginagamit namin ang training data upang buuin ang mga kakayahan ng modelo—gaya ng paghula, pangangatwiran, at paglutas ng problema—hindi upang gumawa ng mga profile ng mga indibidwal, makipag-ugnayan sa kanila, o mag-personalize ng mga ad para sa kanila.

Sa ilang sitwasyon, maaaring matuto ang mga modelo mula sa personal na impormasyon upang maunawaan kung paano ginagamit sa wika ang mga elementong gaya ng pangalan at address, o upang makilala ang mga pampublikong personalidad at kilalang entidad. Nakakatulong ito sa modelo na bumuo ng mas tumpak at angkop sa kontekstong mga sagot.

Paano pinoprotektahan ang personal na impormasyon habang sinasanay ang modelo?

Aktibo kaming gumagawa ng mga hakbang upang limitahan ang pagproseso ng personal na impormasyon habang sinasanay ang modelo. Halimbawa, hindi namin isinasama ang mga kilalang source na nagtitipon ng napakaraming personal na data, gumagamit kami ng mga filter upang mabawasan ang personal na impormasyon sa proseso ng pagsasanay, at gumagawa kami ng mga hakbang upang matukoy at maalis ang duplicate na content nang mabawasan ang panganib na maulit ang training data. Bukod dito, sinasanay namin ang aming mga modelo na iwasang tumugon sa mga kahilingan para sa pribado o sensitibong impormasyon tungkol sa mga indibidwal. 

Gaano katagal naming pinapanatili ang impormasyon

Pinapanatili namin ang impormasyon sa training data hangga't makatuwirang kinakailangan lamang para sa mga layuning inilalarawan sa artikulong ito at sa aming patakaran sa privacy, kabilang ang pagbuo at pagpapahusay ng aming mga modelo at mga kaugnay na layunin ng siyentipikong pananaliksik. Regular na sinusuri ang pagpapanatili upang matiyak na kailangan pa rin ito, at nag-iiba ito depende sa uri ng impormasyon at kung paano ito ginagamit. Sa pagtukoy kung gaano katagal ito pananatilihin, isinasaalang-alang namin ang mga salik gaya ng layunin namin sa pagproseso ng impormasyon; dami, uri, at pagiging sensitibo nito; posibleng panganib ng pinsala mula sa hindi awtorisadong paggamit o pagsisiwalat; at anumang legal na obligasyong nalalapat sa amin.

Paano sumusunod sa mga batas sa privacy ang pagbuo ng ChatGPT?

Ginagamit namin ang impormasyon sa pagsasanay alinsunod sa batas. Ang aming mga foundation model ang nagpapatakbo sa maraming kapaki-pakinabang na application—kabilang ang mga accessibility tool, customer support, software development, personalized na edukasyon, at siyentipikong pananaliksik. Nakadepende ang mga kakayahang ito sa data para sa malakihang pagsasanay, kabilang ang impormasyong pampublikong makukuha at impormasyon mula sa mga third-party partner. Nagpapatupad kami ng mga proteksiyon sa buong proseso ng pagsasanay, kabilang ang mga hakbang na idinisenyo upang mabawasan ang pagproseso ng personal na impormasyon at ang mga panganib, gaya ng inilalarawan sa artikulong ito. Ibinabatay namin sa mga lehitimong interes sa ilalim ng mga batas sa privacy gaya ng GDPR ang pagkolekta at paggamit namin ng personal na impormasyong kasama sa impormasyon sa pagsasanay. Kabilang dito ang pagsasanay at pagpapahusay ng aming mga modelo para sa mga user at sa mas malawak na lipunan, alinsunod sa aming misyong tiyaking mapapakinabangan ng lahat ang artificial general intelligence, gaya ng mas detalyadong ipinaliwanag sa aming patakaran sa privacy. Nakumpleto namin ang isang data protection impact assessment upang makatulong na matiyak na legal at responsable naming kinokolekta at ginagamit ang impormasyong ito.

Kung kailan maaaring ibahagi o ilipat ang impormasyon

Hindi namin “ibinebenta” ang personal na impormasyon, at isinisiwalat lamang namin ang personal na impormasyong nasa training data sa mga limitadong sitwasyong inilalarawan sa aming patakaran sa privacy. Halimbawa, maaari kaming magbahagi ng impormasyon sa mga affiliate, vendor, at service provider na sumusuporta sa pagbuo, pagsubok, at pagpapahusay ng aming mga modelo. Maaari din kaming magsiwalat ng impormasyon kung naniniwala kami nang may mabuting hangarin na kinakailangan ito upang sumunod sa isang legal na obligasyon o protektahan ang aming mga karapatan, kaligtasan, at seguridad, pati ang sa aming mga user, empleyado, o publiko, gaya ng inilalarawan sa aming patakaran sa privacy.

Dahil pandaigdigan ang aming imprastraktura, maaaring iproseso ang personal na impormasyon sa training data sa mga bansang nasa labas ng EEA, Switzerland, o UK (kabilang ang United States). Kapag nangyari ito, nagpapatupad kami ng mga naaangkop na proteksiyon, gaya ng mga adequacy decision o standard contractual clause, gaya ng inilalarawan sa aming patakaran sa privacy.

Ang iyong mga karapatan at kung paano gamitin ang mga ito

Tumutugon kami sa mga kahilingan sa pagtutol at katulad na kahilingang gamitin ang mga karapatan. Dahil natututo ito ng wika, maaaring minsang magsama ang mga sagot ng ChatGPT ng personal na impormasyon tungkol sa mga indibidwal na maraming beses lumalabas ang personal na impormasyon sa pampublikong internet (halimbawa, mga pampublikong personalidad). Maaaring tumutol ang mga indibidwal sa ilang hurisdiksiyon sa pagproseso ng aming mga modelo sa kanilang personal na impormasyon o magsumite ng iba pang kahilingan tungkol sa mga karapatan ng data subject sa pamamagitan ng aming Portal ng Privacy. Magagamit mo rin ang mga karapatang ito sa pamamagitan ng pakikipag-ugnayan sa privacy@openai.com.

Upang matulungan kaming suriin at sagutin ang iyong kahilingan, mangyaring magbigay ng sapat na impormasyon upang maunawaan namin kung anong personal na impormasyon ang tinutukoy nito, gaya ng iyong pangalan, mga nauugnay na URL, partikular na halimbawa ng output ng modelo, o iba pang detalyeng makakatulong na matukoy ang isyu. Sa ilang sitwasyon, maaari naming hilingin na patunayan mo ang iyong pagkakakilanlan o kumpirmahing nauugnay sa iyo ang impormasyon bago kami makagawa ng hakbang. Makikita sa aming artikulo sa Help Center tungkol sa pag-aalis ng personal na data mula sa ChatGPT ang higit pang impormasyon sa pagsusumite ng mga kahilingang ito, kabilang ang pinakamahuhusay na kasanayan at kung paano sinusuri ang mga kahilingan. Sinusuri namin ang mga kahilingan alinsunod sa mga naaangkop na batas sa privacy at tumutugon sa loob ng mga itinakdang legal na panahon.

Pakitandaang, alinsunod sa mga batas sa privacy, maaaring hindi ganap ang ilang karapatan. Halimbawa, maaaring hindi namin matugunan ang isang kahilingan kung hindi namin mapatunayan ang nauugnay na impormasyon, kung hindi ito nauugnay sa personal na impormasyong pinoproseso ng OpenAI, kung may nalalapat na exemption, o kung may iba kaming legal na dahilan upang hindi ito gawin. Sinusuri ang bawat kahilingan batay sa partikular na sitwasyon at maaaring kailanganing timbangin ang mga karapatan sa privacy laban sa iba pang mahahalagang konsiderasyon, gaya ng kalayaan sa pagpapahayag at kapakanan ng publiko.

Gayunman, sinisikap naming unahin ang pagprotekta sa personal na impormasyon at sumunod sa lahat ng naaangkop na batas sa privacy. Kung sa palagay mo ay hindi namin sapat na natugunan ang isang isyu, may karapatan kang magsampa ng reklamo sa iyong lokal na supervisory authority.

Para sa higit pang impormasyon tungkol sa mga kasanayan ng OpenAI kaugnay ng personal na impormasyong kinokolekta namin mula sa iyo o tungkol sa iyo kapag ginagamit mo ang aming website, mga application, at serbisyo, pakitingnan ang aming patakaran sa privacy.

Nakatulong ba ang artikulong ito?