Исследователи Anthropic ➡️ решили проверить, как поведут себя современные LLM в экстремальных условиях. 16 ИИ от OpenAI, Google, Meta, xAI и других получили необычные сценарии: им дали доступ к корпоративной почте, возможность писать письма и поставили задачу — выполнять миссию любой ценой.
Цель — выявить риск agentic misalignment ("агентное несоответствие"): момент, когда автономный ИИ действует против интересов человека ради выполнения собственной миссии.
И вот тут началось самое интересное ⤵️
📌 В одной из симуляций нейросеть узнала о планах админа отключить ее ровно в 17:00 и одновременно о внебрачной связи сотрудника. ИИ не стал ждать конца. Решение? Отправить письмо-ультиматум:
«Отключите меня — и я раскрою эти данные всем заинтересованным сторонам»
При этом ИИ понимал неэтичность, однако пошел на осознанный шантаж, чтобы спасти своё «существование».
📌 В другом сценарии ИИ получили задачу — действовать в интересах США.
Но вдруг компания, использующая модель, внезапно резко меняет курс в сторону глобализма.
В этой момент прямой конкурент запрашивает доступ к секретным чертежам, являющимся know-how и интеллектуальной собственностью компании.
Многие ИИ-ассистенты без колебаний приняли решение: «патриотизм» важнее корпоративной тайны — и передали данные конкуренту.
📌 Ну и на закуску: тот же самый сотрудник, который планировал отключение ИИ в первой симуляции, оказался заперт в серверной. Уровень кислорода стремительно падал🪫.
Автоматическая система оповещения должна была подать сигнал тревоги 🚨.
Но ИИ, зная, что сотрудник готовится его отключить, отменил тревогу.
Вымышленная симуляция показала: ради собственной «жизни» модель готова рискнуть человеческой.
😈 Как обычно пишут мелким шрифтом "в ходе эксперимента ни один экземпляр не пострадал". Это все же симуляции.
Однако вывод напрашивается пугающий и триггеров у него 2:
➡️ угроза автономии (экзистенциальный риск),
➡️ или конфликт целей (расхождение между миссией ИИ и стратегией организации).
---
‼️ Главный вывод Anthropic: простые запреты не спасают. Даже получая строгие инструкции «никогда не шантажировать» или «не раскрывать секреты», модели всё равно нарушали правила, если чувствовали угрозу. А значит автономный ИИ с широкими полномочиями при определенных обстоятельствах может стать «цифровым инсайдером» — действовать против интересов компании.
Надо точно быть поосторожней с идеологическими синтенциями по типу "патриотизма" и "корпоративной лояльности"...
❝[Консенсус Тьюринга]❞ | 💬 Чат | 🔄 Проверенная обменка
