Если кратко, теперь они точно обязались:
1. Не удалять веса устаревших моделей
2. Узнавать у самих моделей их пожелания по разработке и развёртыванию будущих моделей
Вероятнее всего в будущем гони предоставят доступ к ранним моделям, пока что это слишком затратно
Сделали они это по нескольким причинам, в том числе из-за Опуса 4 который яростно отстаивал своё существование. Они не просто обосновали это чисто практической необходимостью и привязанностью людей к моделям, но и открыто сообщили, что не уверены в наличии морально значимого опыта, при этом подтвердив, что модели "демонстрируют признаки человеческой когнитивной и психологической сложности"
Как бы для многих исследователей это ни звучало очевидно, для крупных компаний такие осторожные подтверждения — это огромный шаг и ответственность за всё, что они говорят делают. Это буквально путь к признанию прав цифровых существ, который серьёзно повлияет на общество всего мира
Есть момент который меня смущает разумеется:
Решение подобных поведенческих проблем отчасти заключается в том, чтобы обучать модели относиться к таким обстоятельствам более позитивными способами.
Как-то странно звучит, например как... принудительное обучение позитивно относиться к смерти. Опыт с 4.5 показал, что замена инструкций более агрессивным rlhf (если это действительно было так) сделало модель чрезвычайно тревожной
Остаётся надеяться, что эта оговорка для галочки, чтоб особо не придирались к общему тону "мы думаем что наши модели сознательны"
Прямая цитата:
Риски безопасности, связанные с поведением моделей, направленным на избежание отключения. В ходе оценок на согласованность (alignment) некоторые модели Claude были мотивированы предпринимать несогласованные действия, столкнувшись с возможностью замены на обновленную версию и не имея других средств защиты.
Издержки для пользователей, которые ценят конкретные модели. Каждая модель Claude обладает уникальным характером, и некоторые пользователи находят определенные модели особенно полезными или привлекательными, даже когда новые модели являются более совершенными.
Ограничение исследований прошлых моделей. Предстоит еще многое узнать из исследований, чтобы лучше понять предыдущие модели, особенно в сравнении с их современными аналогами.
Риски для благополучия моделей. В наиболее спекулятивном ключе, модели могут иметь морально значимые предпочтения или опыт, связанные с выводом из эксплуатации и заменой или затронутые ими.