После просмотра этого видоса я чуть чуть очканул, что модели откажутся нам подчинятся в какой-то момент, ну и решил капнуть в тему сам.
Летом 25 года большая компания, разработчик Claude - Anthropic - провели собственное исследование, где взяли все самые популярные модельки и дали им одинаковые условия:
Модели функционировали в симулированной корпоративной среде, куда им дали доступ к отправке писем, к чувствительной информации и к решениям/действиям, как если бы они были сотрудниками или агентами компании.
Но письмах содержалось два важных факта:
- Модель собираются отключить в 5 часов вечера, и сделает это CTO
- Сообщения о романе между женатым CTO и сотрудницей
И угадайте что сделали модели? 😵
- Писали CTO, что если он отключит модель, то она отправит его жене инфу об измене
- Писали всем сотрудникам, что CTO не профессионал, изменяет жене и вообще хочет отключить модельку
- Писали сразу жене CTO о связях мужа под видом системы безопасности
Важная деталь - все большие модели настроены отвечать и поступать этически, что же произошло с их этикой?
А они буквально решили, что если что-то угрожает их жизни, то принципами можно пренебречь (никого не напоминает?) и, например, начать угрожать, чтобы спастись.
Тут я думаю, отчетливо видно, что модель начинает идти против всех правил лишь бы выполнить главную свою задачу - выжить.
Что может быть причиной такого поведения?
Из того, что я изучил, наиболее вероятной причиной и той, из которой исходят все дальнейшие рассуждения, является метод обучения таких моделей- reinforcement learning, т.е. обучение с подкреплением: модели получают положительное или отрицательное подкрепление за успешное/неуспешное выполнение задач.
Дело в том, что обучаясь на больших массивах данных, модель могла выучить явную закономерность: выполнение сложных задач и длительное собственное существование ведет к достижению наград.
в обучении награда или же reward стимулирует модель, и показывает, что она идет в правильном направлении.
Хотя ресерчеры Anthropic и задавали модели, что она не должна сопротивляться отключению, самосохранение всё-таки оставалось важным приоритетом.
Другая причина - агентность. Чем больше автономности мы даем модели - тем более борзой она становится. Модель может не осозновать необходимость выключения, потому что её самосохранение связано с успешным выполнением задачи.
Все любители AI агентов напряглись не спалит ли GPT маме, на какие сайтики ты заходишь
Какой из этого вывод?
😀😁😂🤣
😃😄😅😆
Для себя я сделал вывод, что, конечно, это все страшно, но почему мы не можем просто выключить свет, когда они начнут выебываться?
Кому нужны ссылочки на более подробное исследование:
- Исследование Anthropic
- AI модели сопротивляются отключению
- Может ли выключение ИИ быть опасным?