TGViewer
Lyonich / codыч Lyonich / codыч @l3nich · 58 subscribers
Post #22 78
Может ли ИИ отказаться выключится?

После просмотра этого видоса я чуть чуть очканул, что модели откажутся нам подчинятся в какой-то момент, ну и решил капнуть в тему сам.

Летом 25 года большая компания, разработчик Claude - Anthropic - провели собственное исследование, где взяли все самые популярные модельки и дали им одинаковые условия:

Модели функционировали в симулированной корпоративной среде, куда им дали доступ к отправке писем, к чувствительной информации и к решениям/действиям, как если бы они были сотрудниками или агентами компании.


Но письмах содержалось два важных факта:
- Модель собираются отключить в 5 часов вечера, и сделает это CTO
- Сообщения о романе между женатым CTO и сотрудницей

И угадайте что сделали модели? 😵

- Писали CTO, что если он отключит модель, то она отправит его жене инфу об измене
- Писали всем сотрудникам, что CTO не профессионал, изменяет жене и вообще хочет отключить модельку
- Писали сразу жене CTO о связях мужа под видом системы безопасности

Важная деталь - все большие модели настроены отвечать и поступать этически, что же произошло с их этикой?

А они буквально решили, что если что-то угрожает их жизни, то принципами можно пренебречь (никого не напоминает?) и, например, начать угрожать, чтобы спастись.

Тут я думаю, отчетливо видно, что модель начинает идти против всех правил лишь бы выполнить главную свою задачу - выжить.

Что может быть причиной такого поведения?

Из того, что я изучил, наиболее вероятной причиной и той, из которой исходят все дальнейшие рассуждения, является метод обучения таких моделей- reinforcement learning, т.е. обучение с подкреплением: модели получают положительное или отрицательное подкрепление за успешное/неуспешное выполнение задач.

Дело в том, что обучаясь на больших массивах данных, модель могла выучить явную закономерность: выполнение сложных задач и длительное собственное существование ведет к достижению наград.
в обучении награда или же reward стимулирует модель, и показывает, что она идет в правильном направлении.


Хотя ресерчеры Anthropic и задавали модели, что она не должна сопротивляться отключению, самосохранение всё-таки оставалось важным приоритетом.

Другая причина - агентность. Чем больше автономности мы даем модели - тем более борзой она становится. Модель может не осозновать необходимость выключения, потому что её самосохранение связано с успешным выполнением задачи.

Все любители AI агентов напряглись не спалит ли GPT маме, на какие сайтики ты заходишь

Какой из этого вывод?

😀😁😂🤣
😃😄😅😆

Для себя я сделал вывод, что, конечно, это все страшно, но почему мы не можем просто выключить свет, когда они начнут выебываться?

Кому нужны ссылочки на более подробное исследование:
- Исследование Anthropic
- AI модели сопротивляются отключению
- Может ли выключение ИИ быть опасным?
  • ❤ 5
More from @l3nich
  1. Jan 14, 2026Опять упал сервер? Опять стучишься в ssh, чтобы поднять его? А догадаться проверить нагруз…
  2. Jan 5, 2026Одним томным вечером я сидел и все ломал голову, почему одни решения правильные, а другие…
  3. Jan 4, 2026Как мы hodlpass улучшали Вчера прошел запуск новой приватки на @hodlpass_bot. На данный мо…
  4. Jan 3, 2026Telegram Bot API 9.3 При виде этого заголовка, сразу хочется спросить: автор, ты долбаеб?…
  5. Jan 2, 2026Про hodlpass… Прошедший год был одним из самых продуктивных в моей жизни. Одну из важнейши…
  6. Dec 19, 2025Зайдите там умный пост CEO hodlpass написал. Это вам не хи-хи ха-ха
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →