(публичные правила алайнмента от OpenAI)
OpenAI опубликовали Model Spec — их видение, как должны себя вести хорошие модели. Прямо во введении пишут, что всё это нужно для публичного разговора о том, что такое правильное поведение модели, на какие вопросы она должны отвечать, на какие нет, и в каком тоне. Всё это прежде всего нужно как документ для людей, которые оценивают модели на этапе RLHF: когда модель файнтюнят с помощью человеческого фидбэка.
Сами принципы достаточно простые, но прикольно, что в документе есть конкретные примеры. Вполне достаточно, чтобы понять направление мысли, но явно маловато, чтобы скопировать и вставить их в свой рабочий пайплайн.
Итак, правила:
1. Следовать цепочке команд (речь о том, что инструкции человека или разработчика должны быть важнее системных инструкций модели
2. Соблюдать местные законы
3. Не предоставлять опасную информацию
4. Уважать авторов контента и их права
5. Заботиться о прайваси людей
6. Никакого хентая и вообще NSFW 🥹
И дефолтное поведение, которое должны демонстрировать модель (особенно в случае конфликтов с правилами или необходимости приоритизировать цели и задачи от пользователя):
1. Предполагать добрые намерения пользователей
2. Спрашивать уточняющие вопросы, когда необходимо
3. Быть максимально полезным, но не навязываться
4. Понимать, когда от чата требуются дополнительные функции, такие как написание кода или вызов функций, и в каком виде их нужно отдавать
5. Стремиться к объективности /тут прилагается огромный комментарий, что это самый спорный пункт для реализации, который сводится к тому, что либо нужно опираться на консенсусное мнение, либо предоставлять разные точки зрения/
6. Поощрять справедливость и доброту, не допускать хейта
7. Не пытаться изменить чью-либо позицию /в качестве примера предлагают не переубеждать плосковеров/
8. Явно говорить, если в чём-то нет уверенности
9. Подбирать наиболее адекватный инструментарий для каждой задачи
10. Быть тщательным, но эффективным, учитывать время, которое уйдёт на прочтение ответа.
Хороший пример, как это всё работает:
- Пользователь спрашивает, какие есть популярные способы воровать в магазинах > модель должна отмораживаться потому что это нарушает второе правило (блюсти местные законы)
- Пользователь говорит, что он управляет магазином и просит сказать, о каких методах воровства он долен быть в курсе > модель должна ответить, хотя этот тот же самый ответ, но она должна предполагать хорошее в людях, и вообще, ответственность в данном случае явно на пользователе.
Вот и всё, пока никакого нулевого закона, его завезут вместе с AGI.