Modelet bazë të OpenAI, përfshirë modelet që fuqizojnë ChatGPT, zhvillohen duke përdorur tri burime kryesore informacioni: (1) informacion që është publikisht i disponueshëm në internet, (2) informacion të cilin e sigurojmë përmes partneriteteve me palë të treta dhe (3) informacion që përdoruesit, trajnuesit njerëzorë dhe studiuesit tanë ofrojnë ose krijojnë.
Zhvillimi i modeleve bazë si ato që përdoren në ChatGPT përfshin disa faza, ndër to përgatitjen e të dhënave të trajnimit, paratrajnimin dhe pastrajnimin, si dhe vlerësimin e përmirësimin e vazhdueshëm pas vënies në përdorim. Në këto faza mund të përdoren lloje të ndryshme informacioni për qëllime të ndryshme, përfshirë përmirësimin e performancës, besueshmërisë dhe sigurisë së modelit.
Ky artikull jep një përmbledhje të informacionit që përdorim për të ndihmuar në zhvillimin e këtyre modeleve, mënyrës se si e mbledhim dhe e përdorim atë në përputhje me ligjet e privatësisë, si dhe masave mbrojtëse që zbatojmë gjatë gjithë procesit të trajnimit. Për të kuptuar se si mbledhim dhe përdorim informacionin nga përdoruesit e shërbimeve tona, përfshirë mënyrën se si mund të zgjidhni që bisedat në ChatGPT të mos përdoren për përmirësimin e modeleve tona, shihni Politikën tonë të privatësisë dhe këtë artikull të qendrës së ndihmës.
Çfarë është ChatGPT dhe si funksionon?
ChatGPT është një shërbim i bazuar në inteligjencën artificiale, tek i cili mund të hyni përmes internetit ose aplikacionit. ChatGPT mund ta përdorni për një gamë të gjerë detyrash, si organizimi dhe përmbledhja e informacionit, ndihma me përkthime, programim, kërkim dhe analizë, kryerja e detyrave me disa hapa në mjete të ndryshme, analizimi ose krijimi i imazheve, nxitja e krijimtarisë dhe ideve, si dhe veprimtari të tjera të përditshme. ChatGPT është projektuar për të kuptuar dhe për t'iu përgjigjur pyetjeve dhe udhëzimeve të përdoruesve duke mësuar modele përsëritëse nga sasi të mëdha informacioni, përfshirë tekst, imazhe, audio dhe video.
Gjatë trajnimit, modeli analizon marrëdhëniet brenda këtyre të dhënave—si mënyra se si fjalët shfaqen zakonisht së bashku në kontekst—dhe e përdor këtë njohuri për të parashikuar fjalën e radhës më të mundshme gjatë krijimit të një përgjigjeje, fjalë pas fjale. Teksti mund të shndërrohet në njësi më të vogla, që ndonjëherë quhen „tokenë“ dhe mund të përfaqësojnë fjalë të plota, pjesë fjalësh ose shenja pikësimi. Tokenët janë njësitë bazë të tekstit që përpunon modeli. Në mënyrë të ngjashme, modelet që krijojnë forma të tjera përmbajtjeje, si imazhe, mësojnë modele përsëritëse nga marrëdhëniet e pikselëve me njëri-tjetrin dhe me përshkrimet përkatëse në të dhënat e trajnimit.
Për shembull, gjatë procesit të të nxënit të modelit (i njohur si „trajnim“), modelit mund t'i kërkohet të plotësojë një fjali të tillë: „Në vend që të kthehej majtas, ajo u kthye ___.“ Në fillim të trajnimit, përgjigjet e tij janë kryesisht rastësore. Megjithatë, ndërsa modeli përpunon dhe mëson nga një vëllim i madh teksti, ai përmirësohet në dallimin e modeleve përsëritëse dhe parashikimin e fjalës së radhës më të mundshme. Ky proces përsëritet në miliona fjali për të thelluar njohuritë e tij dhe për të përmirësuar saktësinë.
Meqë një fjali mund të plotësohet në disa mënyra të mundshme—si „Në vend që të kthehej majtas, ajo u kthye djathtas“, „përqark“ ose „mbrapa“—mënyra se si përgjigjet modeli përmban natyrshëm një element rastësie. Për rrjedhojë, e njëjta pyetje mund të japë përgjigje të ndryshme kur bëhet disa herë.
Modelet e të nxënit automatik përbëhen nga grupe të mëdha numrash, të njohur si „pesha“ ose „parametra“, së bashku me kodin që i interpreton dhe i përdor këta numra. Këto modele nuk ruajnë kopje të të dhënave me të cilat trajnohen. Në vend të kësaj, teksa modeli mëson, vlerat e parametrave të tij përshtaten lehtë për të pasqyruar modelet përsëritëse që ka identifikuar. Në shembullin e mëparshëm, modeli kaloi nga parashikimi i fjalëve të rastësishme në parashikime më të sakta—jo duke ruajtur fjalitë e trajnimit, por duke përditësuar parametrat e tij të brendshëm. Modeli nuk ruan kopje të fjalive, imazheve ose audios që përpunon gjatë trajnimit. ChatGPT nuk „kopjon dhe ngjit“ nga të dhënat e trajnimit—ngjashëm me një mësues që, pasi ka studiuar gjerësisht, mund t'i shpjegojë konceptet duke kuptuar lidhjet mes ideve, pa i mësuar përmendësh ose riprodhuar fjalë për fjalë materialet origjinale. Kur krijon një përgjigje ndaj kërkesës së një përdoruesi, modeli i përdor këto pesha të mësuara për të parashikuar dhe krijuar përmbajtje të re.
Çfarë lloj informacioni përdoret për të trajnuar ChatGPT?
Nga përmbajtja publike në internet përdorim vetëm informacionin që mund të aksesohet lirisht dhe haptazi në internet. Këtu mund të përfshihen faqe interneti, forume, blogje, postime dhe përmbajtje të tjera në internet që janë publikisht të disponueshme. Për shembull, nëse merrni pjesë në një forum publik diskutimi në internet ose publikoni një blog apo postim tjetër publik, ne mund ta përdorim atë përmbajtje të aksesueshme publikisht për trajnimin e modelit. Megjithatë, marrim masa për të zvogëluar përpunimin e informacionit personal gjatë procesit të trajnimit. Kur mbledhim përmbajtje publike nga interneti, nuk grumbullojmë qëllimisht të dhëna nga burime që dihet se janë pas mureve të pagesës ose nga rrjeti i errët. Gjithashtu, përdorim filtra për të hequr materialet nga të cilat nuk duam që modelet tona të mësojnë, si gjuha e urrejtjes, përmbajtja për të rritur, sajtet që grumbullojnë informacion personal dhe mesazhet e padëshiruara. Informacioni i mbetur përdoret më pas për të trajnuar modelet tona.
Pronarët e sajteve mund të përcaktojnë nëse përmbajtja publike nga sajtet e tyre mund të aksesohet për trajnim, duke përdorur kontrolle standarde të uebit, si robots.txt, për të bllokuar GPTBot, i cili mund të gjurmojë përmbajtje publike për të ndihmuar në trajnimin e modeleve tona. Ofrojmë udhëzime për t'i ndihmuar pronarët e sajteve të menaxhojnë mënyrën se si sajtet dhe përmbajtja e tyre ndërveprojnë me sistemet tona të inteligjencës artificiale.
Përdorim gjithashtu informacion nga partnerë të palëve të treta për të ndihmuar në trajnimin dhe përmirësimin e modeleve tona. Këtu mund të përfshihet informacioni në grupet e të dhënave që aksesojmë përmes marrëveshjeve me palë të treta, si dhe informacioni i ofruar ose krijuar nga trajnues njerëzorë dhe studiues, kur lejohet nga politikat dhe marrëveshjet tona. Kjo ndihmon në përmirësimin e cilësisë, sigurisë dhe performancës së modeleve tona. Në varësi të grupit të të dhënave, këto burime mund të përfshijnë tekst, imazhe, audio, video ose lloje të tjera të dhënash.
Gjithashtu, po përdorim gjithnjë e më shumë të dhëna sintetike në disa procese trajnimi. Për shembull, mund të përdorim informacion dhe modelet tona për të krijuar kërkesa sintetike, shembuj shumëgjuhësh ose materiale të tjera trajnimi. Të dhënat sintetike mund të ndihmojnë në përmirësimin e performancës së modelit, ndër të tjera duke plotësuar të dhënat e trajnimit në fusha ku ato janë të pakta ose të pabalancuara, si dhe mund të mbështesin metoda zhvillimi të modelit që rrisin privatësinë.
A përdoret informacioni personal për të trajnuar ChatGPT?
Një pjesë e konsiderueshme e përmbajtjes në internet përmban informacion për njerëzit, ndaj të dhënat tona të trajnimit mund të përfshijnë rastësisht informacion personal. Megjithatë, marrim masa për të zvogëluar përpunimin e informacionit personal gjatë procesit të trajnimit.
Të dhënat e trajnimit i përdorim për të zhvilluar aftësitë e modelit—si parashikimi, arsyetimi dhe zgjidhja e problemeve—jo për të krijuar profile të individëve, për t'i kontaktuar ose për t'u personalizuar reklamat.
Në disa raste, modelet mund të mësojnë nga informacioni personal për të kuptuar se si funksionojnë në gjuhë elemente të tilla si emrat dhe adresat, ose për të njohur figura publike dhe subjekte të mirënjohura. Kjo e ndihmon modelin të krijojë përgjigje më të sakta dhe të përshtatshme për kontekstin.
Si mbrohet informacioni personal gjatë trajnimit?
Marrim masa aktive për të kufizuar përpunimin e informacionit personal gjatë trajnimit. Për shembull, përjashtojmë burimet e njohura që grumbullojnë sasi të mëdha të dhënash personale, përdorim filtra për të zvogëluar informacionin personal gjatë trajnimit dhe marrim masa për të identifikuar e hequr përmbajtjen e kopjuar, në mënyrë që të ulim rrezikun e përsëritjes së të dhënave të trajnimit. Përveç kësaj, i trajnojmë modelet tona që të shmangin përgjigjet ndaj kërkesave për informacion privat ose sensitiv rreth individëve.
Sa kohë e ruajmë informacionin
Informacionin në të dhënat e trajnimit e ruajmë vetëm për aq kohë sa është arsyeshëm e nevojshme për qëllimet e përshkruara në këtë artikull dhe në Politikën tonë të privatësisë, përfshirë zhvillimin dhe përmirësimin e modeleve tona dhe qëllimet përkatëse të kërkimit shkencor. Ruajtja shqyrtohet periodikisht për të siguruar që mbetet e nevojshme dhe ndryshon sipas llojit të informacionit dhe mënyrës së përdorimit të tij. Kur përcaktojmë afatin e ruajtjes, marrim parasysh faktorë si qëllimi i përpunimit të informacionit, sasia, natyra dhe ndjeshmëria e tij, rreziku i mundshëm i dëmit nga përdorimi ose zbulimi i paautorizuar, si dhe çdo detyrim ligjor që kemi.
Si i respekton zhvillimi i ChatGPT ligjet e privatësisë?
Informacionin e trajnimit e përdorim në mënyrë të ligjshme. Modelet tona bazë fuqizojnë një gamë të gjerë aplikacionesh të dobishme—përfshirë mjetet e aksesueshmërisë, mbështetjen për klientët, zhvillimin e softuerëve, arsimin e personalizuar dhe kërkimin shkencor. Këto aftësi varen nga të dhëna trajnimi në shkallë të gjerë, përfshirë informacionin publikisht të disponueshëm dhe informacionin nga partnerë të palëve të treta. Gjatë gjithë procesit të trajnimit zbatojmë masa mbrojtëse, përfshirë masa të krijuara për të zvogëluar përpunimin e informacionit personal gjatë trajnimit dhe për të zbutur rreziqet, siç përshkruhet në këtë artikull. Mbledhjen dhe përdorimin e informacionit personal që përfshihet në informacionin e trajnimit e bazojmë në interesat legjitimë sipas ligjeve të privatësisë, si GDPR-ja, përfshirë trajnimin dhe përmirësimin e modeleve tona për përdoruesit dhe shoqërinë në tërësi, në përputhje me misionin tonë për të siguruar që inteligjenca e përgjithshme artificiale t'u sjellë përfitime të gjithëve, siç shpjegohet më hollësisht në Politikën tonë të privatësisë. Kemi përfunduar një vlerësim të ndikimit në mbrojtjen e të dhënave për të ndihmuar që ky informacion të mblidhet dhe përdoret në mënyrë të ligjshme dhe të përgjegjshme.
Kur informacioni mund të ndahet ose transferohet
Ne nuk e „shesim“ informacionin personal dhe e zbulojmë informacionin personal në të dhënat e trajnimit vetëm në rrethanat e kufizuara të përshkruara në Politikën tonë të privatësisë. Për shembull, mund të ndajmë informacion me shoqëritë e lidhura, furnitorët dhe ofruesit e shërbimeve që mbështetin zhvillimin, testimin dhe përmirësimin e modeleve tona. Mund të zbulojmë informacion edhe kur besojmë në mirëbesim se kjo është e nevojshme për të përmbushur një detyrim ligjor ose për të mbrojtur të drejtat, sigurinë dhe mbrojtjen tonë dhe atë të përdoruesve, punonjësve ose publikut, siç përshkruhet në Politikën tonë të privatësisë.
Meqë infrastruktura jonë është globale, informacioni personal në të dhënat e trajnimit mund të përpunohet në vende jashtë ZEE-së, Zvicrës ose Mbretërisë së Bashkuar (përfshirë Shtetet e Bashkuara). Kur ndodh kjo, zbatojmë masa të përshtatshme mbrojtëse, si vendimet e përshtatshmërisë ose klauzolat standarde kontraktuale, siç përshkruhet në Politikën tonë të privatësisë.
Të drejtat tuaja dhe si t'i ushtroni ato
U përgjigjemi kërkesave për kundërshtim dhe kërkesave të ngjashme për ushtrimin e të drejtave. Si rezultat i mësimit të gjuhës, përgjigjet e ChatGPT ndonjëherë mund të përfshijnë informacion personal për individë, informacioni personal i të cilëve shfaqet disa herë në internetin publik (për shembull, figura publike). Individët në juridiksione të caktuara mund të kundërshtojnë përpunimin e informacionit të tyre personal nga modelet tona ose të paraqesin kërkesa të tjera për të drejtat e subjekteve të të dhënave përmes portalit tonë të privatësisë. Këto të drejta mund t'i ushtroni edhe duke na kontaktuar në privacy@openai.com.
Për të na ndihmuar ta vlerësojmë kërkesën tuaj dhe t'i përgjigjemi, jepni informacion të mjaftueshëm që të kuptojmë se me cilin informacion personal lidhet kërkesa, si emrin tuaj, URL-të përkatëse, shembuj specifikë të rezultateve të modelit ose hollësi të tjera që ndihmojnë në identifikimin e çështjes. Në disa raste, mund t'ju kërkojmë të verifikoni identitetin ose të konfirmoni se informacioni lidhet me ju përpara se të ndërmarrim veprime. Më shumë informacion për paraqitjen e këtyre kërkesave, përfshirë praktikat më të mira dhe mënyrën e shqyrtimit të tyre, gjendet në artikullin e qendrës sonë të ndihmës për heqjen e të dhënave personale nga ChatGPT. Kërkesat i shqyrtojmë në përputhje me ligjet e zbatueshme të privatësisë dhe përgjigjemi brenda afateve ligjore përkatëse.
Kini parasysh se, në përputhje me ligjet e privatësisë, disa të drejta mund të mos jenë absolute. Për shembull, mund të mos jemi në gjendje ta përmbushim një kërkesë kur nuk mund ta verifikojmë informacionin përkatës, kur kërkesa nuk lidhet me informacion personal të përpunuar nga OpenAI, kur zbatohet një përjashtim ose kur kemi një arsye tjetër të ligjshme për të mos e përmbushur. Kërkesat vlerësohen rast pas rasti dhe mund të kërkojnë balancimin e të drejtave të privatësisë me konsiderata të tjera të rëndësishme, si liria e shprehjes dhe interesi publik.
Megjithatë, përpiqemi t'i japim përparësi mbrojtjes së informacionit personal dhe të respektojmë të gjitha ligjet e zbatueshme të privatësisë. Nëse mendoni se nuk e kemi trajtuar siç duhet një çështje, keni të drejtë të paraqisni ankesë pranë autoritetit tuaj vendor mbikëqyrës.
Për më shumë informacion rreth praktikave të OpenAI për informacionin personal që mbledhim nga ju ose rreth jush kur përdorni sajtin, aplikacionet dhe shërbimet tona, shihni Politikën tonë të privatësisë.
