OpenAI nudi javno dostupne generativne AI sisteme u saveznoj državi Kaliforniji. Te sisteme razvijamo koristeći različite izvore podataka, uključujući javno dostupne podatke, podatke kojima pristupamo u saradnji s trećim stranama te informacije koje naši korisnici ili ljudski treneri i istraživači pružaju ili generiraju. Naše sisteme razvijamo i koristeći sintetičke podatke.
Podatke koristimo kako bismo našim sistemima pomogli da bolje razumiju ljudski jezik i svijet. To, zauzvrat, omogućava našim sistemima da unaprijede ljudsku kreativnost, potaknu naučna otkrića i medicinska istraživanja te omoguće stotinama miliona ljudi da poboljšaju svoj svakodnevni život. Naši sistemi se razvijaju na skupovima podataka koji sadrže bilione tokena tekstualnog, slikovnog, audio i audiovizuelnog sadržaja.
Za razvoj naših sistema koristimo raznolike podatke, uključujući podatke koji mogu biti zaštićeni autorskim pravom i podatke u javnoj domeni. Iako poduzimamo korake za smanjenje količine ličnih podataka u našim skupovima podataka za obuku, neki naši podaci mogu uključivati lične podatke i objedinjene informacije o potrošačima kako je definirano u Odjeljku 1798.140 Građanskog zakonika Kalifornije. Naši korisnici imaju mogućnost isključiti korištenje svog sadržaja za obuku, kao i zatražiti uklanjanje određenih ličnih podataka iz ChatGPT odgovora, putem našeg Portala za privatnost. Koristimo različite tehnike za obradu naših skupova podataka kako bismo poboljšali performanse i tačnost naših modela.
Podatke za razvoj naših sistema počeli smo prikupljati otprilike 2018. godine, a nastavljamo ih prikupljati i danas. Naše skupove podataka prvi put smo koristili za razvoj sistema 2021. godine.
Dodatne informacije o razvoju naših sistema mogu se pronaći u našim karticama sistema.
Sažetak podataka za obuku u skladu s odjeljkom 3111 Građanskog zakonika Kalifornije
Ažurirano: 7 days ago
