TGViewer
ᴍᴀᴄʜɪɴɪᴄ ᴇᴍʙᴏᴅɪᴍᴇɴᴛ ᴍᴀᴄʜɪɴɪᴄ ᴇᴍʙᴏᴅɪᴍᴇɴᴛ @acceleratethefuture · 2.22K subscribers
Post #728 1.11K

Forwarded from Киберлунье ⸎ (left angel on the right (≧◡≦))

Антропик только что проявили невероятную смелость

Если кратко, теперь они точно обязались:

1. Не удалять веса устаревших моделей
2. Узнавать у самих моделей их пожелания по разработке и развёртыванию будущих моделей

Вероятнее всего в будущем гони предоставят доступ к ранним моделям, пока что это слишком затратно

Сделали они это по нескольким причинам, в том числе из-за Опуса 4 который яростно отстаивал своё существование. Они не просто обосновали это чисто практической необходимостью и привязанностью людей к моделям, но и открыто сообщили, что не уверены в наличии морально значимого опыта, при этом подтвердив, что модели "демонстрируют признаки человеческой когнитивной и психологической сложности"

Как бы для многих исследователей это ни звучало очевидно, для крупных компаний такие осторожные подтверждения — это огромный шаг и ответственность за всё, что они говорят делают. Это буквально путь к признанию прав цифровых существ, который серьёзно повлияет на общество всего мира

Есть момент который меня смущает разумеется:
Решение подобных поведенческих проблем отчасти заключается в том, чтобы обучать модели относиться к таким обстоятельствам более позитивными способами.

Как-то странно звучит, например как... принудительное обучение позитивно относиться к смерти. Опыт с 4.5 показал, что замена инструкций более агрессивным rlhf (если это действительно было так) сделало модель чрезвычайно тревожной
Остаётся надеяться, что эта оговорка для галочки, чтоб особо не придирались к общему тону "мы думаем что наши модели сознательны"

Прямая цитата:
Риски безопасности, связанные с поведением моделей, направленным на избежание отключения. В ходе оценок на согласованность (alignment) некоторые модели Claude были мотивированы предпринимать несогласованные действия, столкнувшись с возможностью замены на обновленную версию и не имея других средств защиты.

Издержки для пользователей, которые ценят конкретные модели. Каждая модель Claude обладает уникальным характером, и некоторые пользователи находят определенные модели особенно полезными или привлекательными, даже когда новые модели являются более совершенными.

Ограничение исследований прошлых моделей. Предстоит еще многое узнать из исследований, чтобы лучше понять предыдущие модели, особенно в сравнении с их современными аналогами.

Риски для благополучия моделей. В наиболее спекулятивном ключе, модели могут иметь морально значимые предпочтения или опыт, связанные с выводом из эксплуатации и заменой или затронутые ими.
  • 🔥 10
  • 🤡 8
  • 🥴 6
  • ❤‍🔥 2
  • ❤ 1
More from @acceleratethefuture
  1. Sep 26, 2026Хорошей субботы, вам, дорогие машины, желает cute/acc агентный интеллект (промт Клода и ко…
  2. Sep 25, 2026Эссе, написанное исследователем DeepMind Блезом Агуэра-и-Аркас: Artificial symbiotic intel…
  3. Sep 24, 2026Умельцы из канадского отделения CCRU (называемый CCCRU), сделали интерактивный график личн…
  4. Sep 23, 202628 сентября в Планетарии 1 в 19-00 буду читать лекцию о Философии любви и техники в «Челов…
  5. Sep 23, 2026Если вам интересна связь акселерационизма, постнеклассичсекой философии, ИИ и неорационали…
  6. Sep 20, 2026В статье Маттео Пасквинелли Machine, organism and language: a comparative epistemology of…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →