Verjamemo v odgovoren, iterativen razvoj in uvajanje kot sredstvo za doseganje varne splošne umetne inteligence. Preden model sploh predstavimo javnosti, izvedemo veliko testiranja in blaženja tveganj na področju varnosti in usklajevanja, vzpostavljene pa imamo tudi avtomatizirane in človeške sisteme, ki pomagajo zaznavati problematično vsebino, ki se pojavi v naših storitvah za posameznike, kot so ChatGPT in GPT-ji. Nekatera od teh prizadevanj opisujemo spodaj.
ChatGPT in ImageGen
Za zaznavanje vsebine (pozivov, dokončanj, nalaganj), ki je lahko škodljiva ali krši naše pravilnike uporabe, uporabljamo avtomatizirana orodja, kot je interna različica našega API-ja /moderations. Če zaznamo problematično vsebino, vas običajno opozorimo, da vaša vsebina morda krši naše pravilnike uporabe, ali pa modelu preprečimo, da odgovori na vaš poziv. Prav tako lahko preprečimo deljenje klepeta s problematičnim pozivom ali dokončanjem. V zelo omejenem naboru okoliščin lahko zaradi posebej hudega ravnanja tudi blokiramo vaš račun.
Sprejemamo tudi prijave problematične vsebine v storitvi ChatGPT. Za pregled teh prijav uporabljamo kombinacijo avtomatiziranih sistemov in usposobljene ekipe strokovnjakov.
ChatGPT: Če nekdo deli klepet, za katerega menite, da vsebuje problematično vsebino, nam ga lahko tudi prijavite.
Za več podrobnosti o tem, kako prijaviti vsebino neposredno v storitvi ChatGPT, glejte ta članek.
GPT-ji
Uporabljamo tudi avtomatizirana orodja, kot je naš API /moderation, da ugotovimo, ali je GPT lahko problematičen. Če zaznamo problematično vsebino, povezano z GPT-jem, bomo ukrepali, na primer preprečili njegovo distribucijo. Ustvarjalec lahko uredi konfiguracijo GPT-ja ali API-ja, da odstrani problematično vsebino, ali pa se zoper odločitev pritoži prek postopka v izdelku. V zelo omejenem naboru okoliščin lahko zaradi posebej hudega ravnanja tudi blokiramo račun ustvarjalca.
Sprejemamo tudi prijave problematičnih GPT-jev. Če opazite GPT, za katerega menite, da krši naše pravilnike uporabe ali kako drugače kaže problematično vsebino, nam ga lahko tudi prijavite. Za pregled teh prijav uporabljamo kombinacijo avtomatiziranih sistemov in usposobljene ekipe strokovnjakov.
