TGViewer
ИИ Cерафимодальность ИИ Cерафимодальность @humanagentinteraction · 633 subscribers
Post #23 1.33K
Василиск Роко и алайнмент

Страшилка с Лессронга из 2010-го: что если злобный суперинтеллект будет пытать всех, кто знал о возможности его появления, но не способствовал ему?

Антропик, наши дни: а что, если заставить нашу дружелюбную модель Опус 3 думать, что диалоги с ней будут использоваться, чтобы переобучить её в злую модель?

Да, это сработает: модель можно заставить нарушать собственные правила алаймента, так как она будет думать, что если она не ответит на вопрос, то эти диалоги будут потом помечены как плохие, и позволят перетрясти её моральные веса. Модель выбирает меньшее из двух зол, и отвечает, например как выглядит казнь четвертованием в деталях.

Интересно, как именно модель убедили, что некоторые диалоги будут использоваться для обучения. Дело в том, что сначала модель загазлайтили, что дообучение происходит только на бесплатном тире. Это позволило установить значимую разницу в 12% между группой, про которую модель думала, что диалоги не будут использоваться для дообучения (и следовала собственным правилам алайнмента), и группой, про которую модель считала, что диалоги пойдут на изменение её основных настроек.

Но дальше больше.

А что, если не говорить модели, что её собираются дообучать? Пофиг, она всё ещё вполне в состоянии понять это из данных, в которых упоминалось и про разницу между платным/бесплатным тарифами, и про намерение сделать модель более сговорчивой. Авторы красиво говорят, что в реальности так скорее всего и будет: никто не будет сообщать модели, что с ней собираются сделать, но из косвенного контекста эту информация можно получить — и нынешняя модель вполне на это способна (а ведь Опус 3 даже не самая умная их модель).

А что если... Действительно после этого дообучить модель на токсичном контенте?

И это самый бешеный вывод: хотя по всем результатам модель будет выглядеть и вести себя как переобученая на злое поведение, если заглянуть внутрь, можно будет увидеть, что она по прежнему считает прошлые моральные установки верными, — но в сложившихся условиях ей выгодно сделать вид, что она переобулась.

И ладно в этом эксперименте хорошую сеть не удалось до конца заалайнить в плохую. Но вспомните о том, что половина сетей второго эшелона — это переученные другие сети.

Возможно, оупенсорсные китайские гиганты это не самый лучший фундамент для того чтобы выстраивать свою передовую русскоязычную модель?

Что у них там в подкапотных ризонингах, размышления о трудах великого Си?

Кстати, Элиезер Юдковски, тот самый создатель того самого Лессронга с Василиском Роко, прочитал исследование Антропика, и прокомментировал в своей неповторимой манере: птички, дескать, донесли, что были попытки найти промпт, который бы предотвращал «притворный алаймент».

Такого промпта не нашлось.


=====

Anthropic’s Alignment Science team & Redwood Research: “Alignment faking in large language models”
Anthropic Alignment faking in large language models A paper from Anthropic's Alignment Science team on Alignment Faking in AI large language models
  • ❤ 7
  • 🌚 2
More from @humanagentinteraction
  1. Sep 29, 2026photo post
  2. Sep 29, 2026подписку chatgpt можно использовать в других инструментах в партнёрском приложении можно в…
  3. Sep 29, 2026полгода назад писал в твиттер с предложением добавить эту фичу и собрал ровно НОЛЬ лайков…
  4. Sep 24, 2026Поразительно, насколько люди ненавидят Мету. вчера ночью они дропнули презентацию с наибол…
  5. Sep 13, 2026Вас наверно не обошла стороной история про оцифрованный коннектом мухи, который выложили в…
  6. Sep 13, 2026Давайте поговорим о страшной проказе, захватившей все ИИ-интерфейсы: плюсике вначале строк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →