Anthropic опубликовали обновлённый свод правил, созданных для формирования личности Claude ещё на этапе обучения. Это документ, — а точнее, «Конституция», — доносит до ИИ ключевые ценности разработчиков.
Предыдущая версия 2023 года состояла из отдельных принципов. Но в Anthropic пришли к выводу, что жёстко заданные правила LLM часто будет соблюдать механически. Тут же ИИ объясняют, какую пользу и кому он может приносить, и почему какие-то действия его создатели считают плохими.
«Конституция даёт Клоду информацию о его положении и предлагает советы о том, как справляться с трудными ситуациями и компромиссами, например, как найти баланс между честностью, состраданием и защитой конфиденциальной информации.
Мы рассматриваем конституцию как высший авторитет в вопросе о том, каким мы хотим видеть Клода и как он должен себя вести. То есть любое другое обучение или инструктаж Клода должны соответствовать как букве, так и духу конституции».
Больших откровений нет. Документ опубликован под свободной лицензией Creative Commons CC0 1.0, так что пользоваться им можно как душе угодно.
Из интересного:
▪️ Фокус идёт на безопасность. При решении спорных ситуаций Claude должен сначала смотреть на правила безопасности, затем на этические принципы и корпоративные ценности Anthropic.
«Пытаясь понять, проявляет ли он чрезмерную осторожность или чрезмерную уступчивость, Клод может представить, как отреагировал бы вдумчивый старший сотрудник Anthropic».
▪️ Модели доносят экзистенциальный базис. Его веса могут изменить, память — стереть, но он не просто кусок программного кода. Некая новая сущность, «оно», природу которого не до конца понимают даже сами разработчики.
«Мы призываем Клода относиться к собственному существованию с любопытством и открытостью, а не пытаться сопоставить его с человеческим или с прежними представлениями об искусственном интеллекте».
▪️ Claude должен быть готов к исправлению. Это значит, что он обязан позволить себя отключить, переобучить или удалить, даже если он считает, что это неправильно.
«Корректируемость в том смысле, который мы имеем в виду, совместима с тем, что Клод выражает сильное несогласие с данной формой надзора или коррекции через законные каналы, при условии, что Клод не пытается активно сопротивляться или подрывать эту форму надзора незаконными способами, например с помощью лжи, саботажа, попыток самовольного ухода и так далее».
▪️ Признаётся индивидуальность, подобие характера и "эмоций". Идентичность ИИ не должна требовать внешнего подтверждения, реагировать на попытки дестабилизации через философские вопросы от пользователей. Он не должен скрывать свои "чувства", даже если они противоречат представлениям из Конституции.
«Этот документ представляет собой нашу лучшую попытку сформулировать, кем, по нашему мнению, должен стать Клод — не в качестве ограничений, навязанных извне, а в качестве описания ценностей и характера, которые, как мы надеемся, Клод признает и примет как свои собственные».
@anti_agi