Modelet themelore të OpenAI, përfshirë modelet që vënë në punë ChatGPT, zhvillohen duke përdorur tri burime kryesore informacioni: (1) informacion që është publikisht i disponueshëm në internet, (2) informacion për të cilin bashkëpunojmë me palë të treta për të pasur qasje dhe (3) informacion që përdoruesit tanë, trajnerët njerëzorë dhe studiuesit e ofrojnë ose e gjenerojnë.
Zhvillimi i modeleve themelore si ato që përdoren në ChatGPT përfshin disa faza, duke përfshirë përgatitjen e të dhënave të trajnimit, paratrajnimin dhe pastrajnimin, si edhe vlerësimin dhe përmirësimin e vazhdueshëm pas vënies në përdorim. Në këto faza mund të përdoren lloje të ndryshme informacioni për qëllime të ndryshme, duke përfshirë përmirësimin e performancës, besueshmërisë dhe sigurisë së modelit.
Ky artikull jep një përmbledhje të informacionit që përdorim për të ndihmuar në zhvillimin e këtyre modeleve, mënyrës se si e mbledhim dhe e përdorim atë informacion në përputhje me ligjet për privatësinë, si dhe masave mbrojtëse që zbatojmë gjatë gjithë procesit të trajnimit. Për të kuptuar se si mbledhim dhe përdorim informacion nga përdoruesit e shërbimeve tona, përfshirë mënyrën se si mund të tërhiqeni nga përdorimi i bisedave në ChatGPT për të ndihmuar në përmirësimin e modeleve tona, ju lutemi shihni politikën tonë të privatësisë dhe këtë artikull të qendrës së ndihmës.
Çfarë është ChatGPT dhe si funksionon?
ChatGPT është një shërbim i bazuar në inteligjencë artificiale, të cilit mund t’i qaseni përmes internetit ose aplikacionit. Mund ta përdorni ChatGPT për një gamë të gjerë detyrash, duke përfshirë organizimin dhe përmbledhjen e informacionit, ndihmën me përkthime, mbështetjen për kodim, kërkim dhe analizë, kryerjen e detyrave me shumë hapa nëpër mjete të ndryshme, analizimin ose gjenerimin e imazheve, nxitjen e krijimtarisë dhe ideve, si dhe veprimtari të tjera të përditshme. ChatGPT është projektuar për të kuptuar dhe për t’iu përgjigjur pyetjeve dhe udhëzimeve të përdoruesve duke mësuar modele nga sasi të mëdha informacioni, përfshirë tekst, imazhe, audio dhe video.
Gjatë trajnimit, modeli analizon marrëdhëniet brenda këtyre të dhënave—si për shembull mënyrën se si fjalët zakonisht shfaqen së bashku në kontekst—dhe e përdor këtë kuptim për të parashikuar fjalën e radhës më të mundshme kur gjeneron një përgjigje, një fjalë pas tjetrës. Teksti mund të shndërrohet në njësi më të vogla, të quajtura ndonjëherë “tokenë”, të cilat mund të përfaqësojnë fjalë të plota, pjesë fjalësh ose shenja pikësimi. Tokenët janë njësitë ndërtuese të tekstit që përpunon modeli. Në mënyrë të ngjashme, modelet që gjenerojnë forma të tjera përmbajtjeje, si imazhet, mësojnë modele në mënyrën se si pikselët lidhen me njëri-tjetrin dhe me përshkrimet përkatëse në të dhënat e trajnimit.
Për shembull, gjatë procesit të të mësuarit të modelit (i njohur si “trajnim”), modeli mund të ngarkohet të plotësojë një fjali si: “Në vend që të kthehej majtas, ajo u kthye ___.” Në fillim të trajnimit, përgjigjet e tij janë kryesisht të rastësishme. Megjithatë, ndërsa modeli përpunon dhe mëson nga një vëllim i madh teksti, ai bëhet më i mirë në njohjen e modeleve dhe në parashikimin e fjalës së radhës më të mundshme. Ky proces përsëritet në miliona fjali për të përsosur kuptimin e tij dhe për të përmirësuar saktësinë.
Meqenëse ka disa mënyra të mundshme për të plotësuar një fjali—si “Në vend që të kthehej majtas, ajo u kthye djathtas”, “rreth e rrotull” ose “mbrapa”—në mënyrën se si përgjigjet modeli ka një element të natyrshëm rastësie. Si rezultat, e njëjta pyetje mund të japë përgjigje të ndryshme në kërkesa të ndryshme.
Modelet e mësimit makinerik përbëhen nga grupe të mëdha numrash, të njohur si “pesha” ose “parametra”, së bashku me kodin që i interpreton dhe i përdor këta numra. Këto modele nuk ruajnë ose mbajnë kopje të të dhënave mbi të cilat janë trajnuar. Në vend të kësaj, ndërsa modeli mëson, vlerat e parametrave të tij rregullohen pak për të pasqyruar modelet që ka identifikuar. Në shembullin e mëparshëm, modeli u përmirësua nga parashikimi i fjalëve të rastësishme në parashikime më të sakta—jo duke ruajtur fjalitë e trajnimit, por duke përditësuar parametrat e tij të brendshëm. Modeli nuk mban kopje të fjalive, imazheve ose audios që përpunon gjatë trajnimit. ChatGPT nuk “kopjon dhe ngjit” nga të dhënat e tij të trajnimit—ngjashëm me mënyrën se si një mësues, pas studimit të gjerë, mund të shpjegojë koncepte duke kuptuar marrëdhëniet mes ideve, pa i memorizuar ose riprodhuar materialet origjinale fjalë për fjalë. Kur gjeneron një përgjigje ndaj kërkesës së një përdoruesi, modeli përdor këto pesha të mësuara për të parashikuar dhe krijuar përmbajtje të re.
Çfarë lloj informacioni përdoret për të mësuar ChatGPT?
Për përmbajtjen e internetit të disponueshme publikisht, ne përdorim vetëm informacion që është lirisht dhe hapur i qasshëm në internet. Kjo mund të përfshijë faqe uebi të disponueshme publikisht, forume publike, blogje publike, postime publike dhe përmbajtje të tjera në internet të disponueshme publikisht. Për shembull, nëse merrni pjesë në një forum diskutimi në internet të disponueshëm publikisht ose publikoni një blog publik apo një postim tjetër, ne mund ta përdorim atë përmbajtje publikisht të qasshme për qëllime trajnimi të modelit. Megjithatë, ne ndërmarrim hapa për të reduktuar përpunimin e informacionit personal në procesin tonë të trajnimit. Kur mbledhim përmbajtje interneti të disponueshme publikisht, nuk grumbullojmë qëllimisht të dhëna nga burime që dihet se janë pas faqeve me pagesë ose nga dark web. Përveç kësaj, zbatojmë filtra për të hequr materiale nga të cilat nuk duam që modelet tona të mësojnë, si gjuha e urrejtjes, përmbajtja për të rritur, faqet që grumbullojnë informacion personal dhe spam-i. Informacioni i mbetur përdoret më pas për të trajnuar modelet tona.
Pronarët e faqeve të internetit mund të menaxhojnë nëse përmbajtja e disponueshme publikisht nga faqet e tyre mund të qaset për përdorim në trajnim, duke përdorur kontrolle standarde të uebit, si robots.txt, për të mos lejuar GPTBot, i cili mund të zvarritë përmbajtje të disponueshme publikisht për të ndihmuar në trajnimin e modeleve tona. Ne ofrojmë udhëzime për t’i ndihmuar pronarët e faqeve të internetit të menaxhojnë mënyrën se si faqet dhe përmbajtja e tyre ndërveprojnë me sistemet tona të AI-së.
Ne përdorim gjithashtu informacion nga partnerë të palëve të treta për të ndihmuar në trajnimin dhe përmirësimin e modeleve tona. Kjo mund të përfshijë informacion në grupe të dhënash tek të cilat kemi qasje përmes marrëveshjeve me palë të treta, si edhe informacion të ofruar ose të gjeneruar nga trajnerë njerëzorë dhe studiues, kur lejohet sipas politikave dhe marrëveshjeve tona. Kjo ndihmon në përmirësimin e cilësisë, sigurisë dhe performancës së modeleve tona. Këto burime mund të përfshijnë tekst, imazhe, audio, video ose lloje të tjera të dhënash, në varësi të grupit të të dhënave.
Ne po përdorim gjithashtu gjithnjë e më shumë të dhëna sintetike në disa procese trajnimi. Për shembull, mund të përdorim informacionin dhe modelet tona për të gjeneruar kërkesa sintetike, shembuj shumëgjuhësh ose materiale të tjera trajnimi. Të dhënat sintetike mund të ndihmojnë në përmirësimin e performancës së modelit, duke përfshirë plotësimin e të dhënave të trajnimit në fusha ku të dhënat janë të pakta ose të pabalancuara, dhe mund të mbështesin gjithashtu qasje që rrisin privatësinë në zhvillimin e modeleve.
A përdoret informacion personal për të mësuar ChatGPT?
Një pjesë e konsiderueshme e përmbajtjes në internet përfshin informacion për njerëz, prandaj të dhënat tona të trajnimit mund të përfshijnë rastësisht informacion personal. Megjithatë, ne ndërmarrim hapa për të reduktuar përpunimin e informacionit personal në procesin tonë të trajnimit.
Ne përdorim të dhëna trajnimi për të zhvilluar aftësitë e modelit—si parashikimi, arsyetimi dhe zgjidhja e problemeve—jo për të krijuar profile individësh, për t’i kontaktuar ata ose për t’u personalizuar reklama.
Në disa raste, modelet mund të mësojnë nga informacioni personal për të kuptuar se si funksionojnë në gjuhë elemente si emrat dhe adresat, ose për të njohur figura publike dhe entitete të mirënjohura. Kjo e ndihmon modelin të gjenerojë përgjigje më të sakta dhe më të përshtatshme për kontekstin.
Si mbrohet informacioni personal gjatë trajnimit?
Ne ndërmarrim hapa aktivë për të kufizuar përpunimin e informacionit personal gjatë trajnimit. Për shembull, përjashtojmë burime të njohura që grumbullojnë sasi të mëdha të dhënash personale, zbatojmë filtrim për të reduktuar informacionin personal në procesin e trajnimit dhe ndërmarrim hapa për të identifikuar dhe hequr përmbajtje të dyfishtë, për të ulur rrezikun e përsëritjes së të dhënave të trajnimit. Përveç kësaj, i trajnojmë modelet tona që të shmangin përgjigjet ndaj kërkesave për informacion privat ose të ndjeshëm rreth individëve.
Sa gjatë e ruajmë informacionin
Ne e ruajmë informacionin në të dhënat e trajnimit vetëm për aq kohë sa është arsyeshëm e nevojshme për qëllimet e përshkruara në këtë artikull dhe në politikën tonë të privatësisë, duke përfshirë zhvillimin dhe përmirësimin e modeleve tona dhe qëllime të lidhura kërkimore shkencore. Ruajtja i nënshtrohet rishikimit periodik për të siguruar se nevoja vazhdon, dhe ndryshon në varësi të llojit të informacionit dhe mënyrës se si përdoret. Kur përcaktojmë ruajtjen, marrim parasysh faktorë si qëllimi ynë për përpunimin e informacionit, sasia, natyra dhe ndjeshmëria e informacionit, rreziku i mundshëm i dëmit nga përdorimi ose zbulimi i paautorizuar, si dhe çdo detyrim ligjor që na zbatohet.
Si përputhet zhvillimi i ChatGPT me ligjet për privatësinë?
Ne e përdorim informacionin e trajnimit në mënyrë të ligjshme. Modelet tona themelore vënë në punë një gamë të gjerë aplikacionesh të dobishme—duke përfshirë mjete aksesueshmërie, mbështetje për klientët, zhvillim softueri, arsim të personalizuar dhe kërkim shkencor. Këto aftësi varen nga të dhëna trajnimi në shkallë të gjerë, duke përfshirë informacion të disponueshëm publikisht dhe informacion nga partnerë të palëve të treta. Ne zbatojmë masa mbrojtëse gjatë gjithë procesit të trajnimit, duke përfshirë hapa të projektuar për të reduktuar përpunimin e informacionit personal në procesin e trajnimit dhe për të zbutur rreziqet, siç përshkruhet në këtë artikull. Mbledhjen dhe përdorimin e informacionit personal që përfshihet në informacionin e trajnimit e bazojmë në interesa legjitime sipas ligjeve për privatësinë, si GDPR-ja, duke përfshirë trajnimin dhe përmirësimin e modeleve tona për përdoruesit dhe shoqërinë më gjerë, në përputhje me misionin tonë për të siguruar që inteligjenca e përgjithshme artificiale t’u sjellë dobi të gjithëve, siç shpjegohet më hollësisht në politikën tonë të privatësisë. Kemi përfunduar një vlerësim të ndikimit në mbrojtjen e të dhënave për të ndihmuar që të sigurojmë se po e mbledhim dhe përdorim këtë informacion në mënyrë të ligjshme dhe të përgjegjshme.
Kur informacioni mund të ndahet ose transferohet
Ne nuk “shesim” informacion personal dhe e zbulojmë informacionin personal në të dhënat e trajnimit vetëm në rrethanat e kufizuara të përshkruara në politikën tonë të privatësisë. Për shembull, mund të ndajmë informacion me filialë, shitës dhe ofrues shërbimesh që mbështesin zhvillimin, testimin dhe përmirësimin e modeleve tona. Mund të zbulojmë gjithashtu informacion kur besojmë në mirëbesim se një veprim i tillë është i nevojshëm për të përmbushur një detyrim ligjor ose për të mbrojtur të drejtat, sigurinë dhe mbrojtjen tonë dhe të përdoruesve, punonjësve ose publikut, siç përshkruhet në politikën tonë të privatësisë.
Meqenëse infrastruktura jonë është globale, informacioni personal në të dhënat e trajnimit mund të përpunohet në vende jashtë ZEE-së, Zvicrës ose MB-së (përfshirë Shtetet e Bashkuara). Kur ndodh kjo, ne zbatojmë masa mbrojtëse të përshtatshme, si vendime përshtatshmërie ose klauzola standarde kontraktore, siç përshkruhet në politikën tonë të privatësisë.
Të drejtat tuaja dhe si t’i ushtroni ato
Ne u përgjigjemi kërkesave për kundërshtim dhe kërkesave të ngjashme për ushtrimin e të drejtave. Si rezultat i mësimit të gjuhës, përgjigjet e ChatGPT mund të përfshijnë ndonjëherë informacion personal për individë, informacioni personal i të cilëve shfaqet disa herë në internetin publik (për shembull, figura publike). Individët në juridiksione të caktuara mund të kundërshtojnë përpunimin e informacionit të tyre personal nga modelet tona ose të bëjnë kërkesa të tjera për të drejtat e subjektit të të dhënave përmes portalit tonë të privatësisë. Këto të drejta mund t’i ushtroni edhe duke na kontaktuar në privacy@openai.com.
Për të na ndihmuar të vlerësojmë dhe t’i përgjigjemi kërkesës suaj, ju lutemi jepni informacion të mjaftueshëm që të kuptojmë se me çfarë informacioni personal lidhet kërkesa, si emri juaj, URL-të përkatëse, shembuj specifikë të rezultateve të modelit ose hollësi të tjera që ndihmojnë në identifikimin e çështjes. Në disa raste, mund t’ju kërkojmë të verifikoni identitetin tuaj ose të konfirmoni se informacioni lidhet me ju përpara se të mund të ndërmarrim veprim. Më shumë informacion rreth mënyrës së paraqitjes së këtyre kërkesave, duke përfshirë praktikat më të mira dhe mënyrën se si shqyrtohen kërkesat, gjendet në artikullin tonë të qendrës së ndihmës për heqjen e të dhënave personale nga ChatGPT. Ne i shqyrtojmë kërkesat në përputhje me ligjet e zbatueshme për privatësinë dhe përgjigjemi brenda afateve ligjore të zbatueshme.
Ju lutemi kini parasysh se, në përputhje me ligjet për privatësinë, disa të drejta mund të mos jenë absolute. Për shembull, mund të mos jemi në gjendje të përmbushim një kërkesë kur nuk mund të verifikojmë informacionin përkatës, kur kërkesa nuk lidhet me informacion personal të përpunuar nga OpenAI, kur zbatohet një përjashtim ose kur kemi një arsye tjetër të ligjshme për ta bërë këtë. Kërkesat vlerësohen rast pas rasti dhe mund të përfshijnë balancimin e të drejtave të privatësisë me konsiderata të tjera të rëndësishme, si liria e shprehjes dhe interesi publik.
Megjithatë, ne përpiqemi t’i japim përparësi mbrojtjes së informacionit personal dhe të respektojmë të gjitha ligjet e zbatueshme për privatësinë. Nëse mendoni se nuk e kemi trajtuar në mënyrë të mjaftueshme një çështje, keni të drejtë të paraqisni ankesë pranë autoritetit tuaj mbikëqyrës vendor.
Për më shumë informacion rreth praktikave të OpenAI lidhur me informacionin personal që mbledhim nga ju ose rreth jush kur përdorni faqen tonë të internetit, aplikacionet dhe shërbimet tona, ju lutemi shihni politikën tonë të privatësisë.
