OpenAI
Această pagină a fost tradusă automat. Vezi articolul original în limba engleză.

Cum identificăm conținutul problematic pe serviciile noastre pentru persoane fizice

Actualizat: 6 days ago

Credem în dezvoltarea și implementarea responsabile și iterative ca mijloc de a obține o inteligență generală artificială sigură. Efectuăm un volum considerabil de testare și atenuare pentru siguranță și aliniere înainte de a lansa vreodată un model publicului și avem, de asemenea, sisteme automatizate și umane pentru a ajuta la detectarea conținutului problematic care apare în serviciile noastre pentru persoane fizice, cum ar fi ChatGPT și GPT-urile. Prezentăm mai jos câteva dintre aceste eforturi.

ChatGPT și ImageGen

Folosim instrumente automatizate, cum ar fi o versiune internă a API-ului /moderations, pentru a detecta conținutul (solicitări, răspunsuri generate, fișiere încărcate) care poate fi dăunător sau poate încălca Politicile noastre de utilizare. Dacă detectăm conținut problematic, de regulă vă avertizăm că acesta ar putea încălca politicile noastre de utilizare sau împiedicăm modelul să răspundă solicitării dvs. De asemenea, este posibil să împiedicăm distribuirea conversației care conține solicitarea sau răspunsul problematic. Într-un număr foarte restrâns de situații, este posibil să vă suspendăm contul pentru abateri grave.

Acceptăm și raportările trimise de persoane cu privire la conținutul problematic din ChatGPT. Pentru a analiza aceste raportări, folosim atât sisteme automatizate, cât și o echipă de experți instruiți.

  • ChatGPT: dacă cineva distribuie o conversație despre care considerați că include conținut problematic, puteți și să ne-o raportați.

Pentru mai multe detalii despre raportarea conținutului direct în ChatGPT, consultați acest articol.

GPT-uri

Folosim și instrumente automatizate, cum ar fi /moderation API, pentru a vedea dacă un GPT este potențial problematic. Dacă detectăm conținut problematic asociat cu GPT-ul, vom lua măsuri, cum ar fi împiedicarea distribuirii acestuia. Creatorul poate edita configurația GPT-ului sau a API-ului pentru a elimina conținutul problematic sau poate contesta decizia printr-un flux din produs. Într-un set foarte limitat de circumstanțe, putem interzice și contul creatorului pentru comportament flagrant.

Acceptăm și raportări din partea oamenilor privind GPT-uri problematice. Dacă vezi un GPT despre care crezi că încalcă politicile noastre de utilizare sau reflectă în alt mod conținut problematic, poți, de asemenea, să ni-l raportezi. Folosim o combinație de sisteme automatizate și o echipă instruită de experți pentru a examina aceste raportări.

A fost util acest articol?