OpenAI
Для перекладу цієї сторінки виконано машинний переклад. Ви можете переглянути оригінальну статтю англійською.

Як ми виявляємо проблемний контент у наших сервісах для користувачів

Learn how OpenAI uses automated systems and human review to identify harmful or policy-violating content in individual services.

Оновлено: 39 minutes ago

Ми віримо у відповідальну, ітеративну розробку й розгортання як спосіб досягнення безпечного штучного загального інтелекту. Перед тим як запускати модель для широкої публіки, ми проводимо значний обсяг тестування й пом’якшення ризиків щодо безпеки та узгодження, а також маємо автоматизовані й людські системи, які допомагають виявляти проблемний контент, що з’являється на наших сервісах для окремих користувачів, як-от ChatGPT і GPTs. Нижче ми описуємо деякі з цих зусиль.

ChatGPT та ImageGen

Ми використовуємо автоматизовані інструменти, як-от внутрішню версію нашого API /moderations, щоб виявляти вміст (запити, відповіді, завантажені матеріали), який може бути шкідливим або порушувати наші Правила використання. Якщо ми виявимо проблемний вміст, то зазвичай або попередимо вас про можливе порушення наших Правил використання, або заблокуємо відповідь моделі на ваш запит. Ми також можемо заборонити поширення чату, що містить проблемний запит або відповідь. У виняткових випадках ми також можемо заблокувати ваш обліковий запис за особливо грубі порушення.

Ми також приймаємо повідомлення від людей про проблемний вміст у ChatGPT. Для перевірки цих повідомлень ми використовуємо автоматизовані системи та залучаємо команду кваліфікованих фахівців.

Докладніше про те, як повідомити про вміст безпосередньо в ChatGPT, див. у цій статті.

GPTs

Ми також використовуємо автоматизовані інструменти, як-от наш /moderation API, щоб з’ясувати, чи є GPT потенційно проблемним. Якщо ми виявимо проблемний контент, пов’язаний із GPT, ми вживемо заходів, наприклад не допустимо його поширення. Розробник може відредагувати конфігурацію GPT або API, щоб видалити проблемний контент, або оскаржити рішення через процес у продукті. У дуже обмеженому переліку випадків ми також можемо заблокувати обліковий запис розробника за кричущу поведінку.

Ми також приймаємо повідомлення від людей про проблемні GPT. Якщо ви бачите GPT, який, на вашу думку, порушує наші правила використання або іншим чином містить проблемний контент, ви також можете повідомити нам про це. Для розгляду таких повідомлень ми використовуємо поєднання автоматизованих систем і навченої команди експертів.

Чи була ця стаття корисною?