Ne besojmë në zhvillim dhe shpërndarje të përgjegjshme e përsëritëse si mjet për të arritur një inteligjencë të përgjithshme artificiale të sigurt. Ne kryejmë shumë testime dhe masa zbutëse të sigurisë dhe përafrimit para se të nxjerrim ndonjë model për publikun, dhe kemi gjithashtu sisteme të automatizuara dhe njerëzore për të ndihmuar në zbulimin e përmbajtjes problematike që shfaqet në shërbimet tona për individët, si ChatGPT dhe GPTs. Më poshtë përshkruajmë disa nga këto përpjekje.
ChatGPT dhe ImageGen
Ne përdorim mjete të automatizuara, si një version të brendshëm të API-së sonë /moderations API, për të zbuluar përmbajtje (kërkesa, plotësime, ngarkime) që mund të jetë e dëmshme ose të shkelë Politikat tona të përdorimit. Nëse zbulojmë përmbajtje problematike, zakonisht ose do t’ju paralajmërojmë se përmbajtja juaj mund të shkelë politikat tona të përdorimit, ose do ta bllokojmë modelin që t’i përgjigjet kërkesës suaj. Mund të parandalojmë gjithashtu ndarjen e bisedës me kërkesën ose plotësimin problematik. Në një numër shumë të kufizuar rrethanash, mund të bllokojmë edhe llogarinë tuaj për sjellje të rëndë.
Pranojmë gjithashtu raportime nga njerëzit për përmbajtje problematike në ChatGPT. Përdorim një kombinim sistemesh të automatizuara dhe një ekip të trajnuar ekspertësh për t’i shqyrtuar këto raportime.
ChatGPT: Nëse dikush ndan një bisedë që besoni se përmban përmbajtje problematike, mund edhe ta raportoni te ne.
Për më shumë hollësi se si të raportoni përmbajtje drejtpërdrejt në ChatGPT, shihni këtë artikull.
GPTs
Ne përdorim gjithashtu mjete të automatizuara, si API-në tonë /moderation API, për të parë nëse një GPT është potencialisht problematik. Nëse zbulojmë përmbajtje problematike të lidhur me GPT-në, do të ndërmarrim veprime, si parandalimi i shpërndarjes së tij. Krijuesi mund të modifikojë konfigurimin e GPT-së ose API-së për të hequr përmbajtjen problematike, ose mund ta apelojë vendimin përmes një fluksi brenda produktit. Në një numër shumë të kufizuar rrethanash, mund të bllokojmë edhe llogarinë e krijuesit për sjellje të rëndë.
Pranojmë gjithashtu raportime nga njerëzit për GPT problematike. Nëse shihni një GPT që besoni se shkel politikat tona të përdorimit ose që ndryshe pasqyron përmbajtje problematike, mund edhe ta raportoni te ne. Përdorim një kombinim sistemesh të automatizuara dhe një ekip të trajnuar ekspertësh për t’i shqyrtuar këto raportime.
