OpenAI
Ez az oldal gépi fordítással készült. Tekintsd meg az eredeti angol nyelvű cikket.

Hogyan azonosítjuk a problémás tartalmakat egyéni szolgáltatásainkon

Learn how OpenAI uses automated systems and human review to identify harmful or policy-violating content in individual services.

Frissítve: yesterday

Hiszünk a felelős, iteratív fejlesztésben és bevezetésben, mint a biztonságos mesterséges általános intelligencia elérésének eszközében. Jelentős mennyiségű biztonsági és igazítási tesztelést és kockázatcsökkentést végzünk, mielőtt egy modellt nyilvánosan elérhetővé tennénk, emellett automatizált és emberi rendszereink is vannak, amelyek segítenek észlelni a szolgáltatásainkon, például a ChatGPT-ben és a GPT-kben megjelenő problémás tartalmakat. Az alábbiakban felvázolunk néhányat ezek közül az erőfeszítések közül.

ChatGPT és ImageGen

Automatizált eszközökkel – például a /moderations API belső verziójával – észleljük az esetlegesen káros vagy a Használati szabályzatunkat sértő tartalmakat (utasításokat, válaszokat és feltöltéseket). Ha problémás tartalmat észlelünk, általában figyelmeztetjük, hogy tartalma sértheti a Használati szabályzatunkat, vagy letiltjuk, hogy a modell válaszoljon az utasítására. A problémás utasítást vagy választ tartalmazó csevegés megosztását is megakadályozhatjuk. Nagyon ritka esetekben, kirívó magatartás miatt a fiókját is letilthatjuk.

A ChatGPT problémás tartalmairól felhasználói bejelentéseket is fogadunk. Ezeket a bejelentéseket automatizált rendszerek és képzett szakértői csapat együttes segítségével vizsgáljuk felül.

  • ChatGPT: Ha valaki olyan csevegést oszt meg, amely Ön szerint problémás tartalmat hordoz, azt bejelentheti nekünk.

A tartalmak közvetlenül a ChatGPT-ben történő bejelentéséről ebben a cikkben talál további részleteket.

GPT-k

Automatizált eszközöket is használunk, például a /moderation API-t, hogy megállapítsuk, egy GPT potenciálisan problémás-e. Ha a GPT-hez kapcsolódó problémás tartalmat észlelünk, intézkedünk, például megakadályozzuk a terjesztését. A készítő szerkesztheti a GPT vagy az API konfigurációját a problémás tartalom eltávolításához, vagy fellebbezhet a döntés ellen egy terméken belüli folyamaton keresztül. Nagyon korlátozott számú esetben kirívó viselkedés miatt a készítő fiókját is letilthatjuk.

Emberi bejelentéseket is fogadunk a problémás GPT-kről. Ha olyan GPT-t látsz, amely szerinted sérti a használati irányelveinket, vagy más módon problémás tartalmat tükröz, akkor azt is jelentheted nekünk. Ezeket a bejelentéseket automatizált rendszerek és képzett szakértői csapat együttesével vizsgáljuk felül.

Hasznos volt ez a cikk?