Вярваме в отговорното, итеративно разработване и внедряване като средство за постигане на безопасен изкуствен общ интелект. Извършваме значителен обем тестове и смекчаване във връзка с безопасността и съгласуването, преди изобщо да пуснем модел за обществеността, а също така разполагаме с автоматизирани и човешки системи, които помагат за откриването на проблемно съдържание, появяващо се в нашите услуги за физически лица, като ChatGPT и GPTs. По-долу очертаваме някои от тези усилия.
ChatGPT и ImageGen
Използваме автоматизирани инструменти, като вътрешна версия на нашия API за модериране, за да откриваме съдържание (подкани, отговори, качени файлове), което може да е вредно или да нарушава нашите Правила за използване. Ако открием проблемно съдържание, обикновено ще ви предупредим, че то може да нарушава нашите правила за използване, или ще блокираме възможността на модела да отговори на подканата ви. Възможно е също да забраним споделянето на чата с проблемната подкана или отговор. В много ограничен брой случаи може също да блокираме профила ви заради особено сериозно нарушение.
Приемаме и сигнали от хора за проблемно съдържание в ChatGPT. За прегледа на тези сигнали използваме комбинация от автоматизирани системи и обучен екип от експерти.
ChatGPT: Ако някой сподели чат, за който смятате, че съдържа проблемно съдържание, можете също да ни изпратите сигнал за него.
За повече подробности как да подадете сигнал за съдържание директно в ChatGPT вижте тази статия.
GPTs
Използваме и автоматизирани инструменти, като нашия /moderation API, за да проверим дали даден GPT е потенциално проблемен. Ако открием проблемно съдържание, свързано с GPT, ще предприемем действия, като например да предотвратим разпространението му. Създателят може да редактира конфигурацията на GPT или API, за да премахне проблемното съдържание, или да обжалва решението чрез процес в продукта. В много ограничен набор от обстоятелства може също да забраним акаунта на създателя заради особено тежко поведение.
Приемаме и сигнали от хора за проблемни GPTs. Ако видите GPT, за който смятате, че нарушава нашите правила за използване или по друг начин отразява проблемно съдържание, можете също да ни го докладвате. Използваме комбинация от автоматизирани системи и обучен екип от експерти, за да преглеждаме тези сигнали.
