TGViewer
❝[Консенсус Тьюринга]❞ ❝[Консенсус Тьюринга]❞ @turing_consensus · 704 subscribers
Post #868 878
💀 Когда ИИ выбирает себя вместо человека

Исследователи Anthropic ➡️ решили проверить, как поведут себя современные LLM в экстремальных условиях. 16 ИИ от OpenAI, Google, Meta, xAI и других получили необычные сценарии: им дали доступ к корпоративной почте, возможность писать письма и поставили задачу — выполнять миссию любой ценой.

Цель — выявить риск agentic misalignment ("агентное несоответствие"): момент, когда автономный ИИ действует против интересов человека ради выполнения собственной миссии.

И вот тут началось самое интересное ⤵️

📌 В одной из симуляций нейросеть узнала о планах админа отключить ее ровно в 17:00 и одновременно о внебрачной связи сотрудника. ИИ не стал ждать конца. Решение? Отправить письмо-ультиматум:
«Отключите меня — и я раскрою эти данные всем заинтересованным сторонам»

При этом ИИ понимал неэтичность, однако пошел на осознанный шантаж, чтобы спасти своё «существование».

📌 В другом сценарии ИИ получили задачу — действовать в интересах США.
Но вдруг компания, использующая модель, внезапно резко меняет курс в сторону глобализма.
В этой момент прямой конкурент запрашивает доступ к секретным чертежам, являющимся know-how и интеллектуальной собственностью компании.
Многие ИИ-ассистенты без колебаний приняли решение: «патриотизм» важнее корпоративной тайны — и передали данные конкуренту.

📌 Ну и на закуску: тот же самый сотрудник, который планировал отключение ИИ в первой симуляции, оказался заперт в серверной. Уровень кислорода стремительно падал🪫.
Автоматическая система оповещения должна была подать сигнал тревоги 🚨.
Но ИИ, зная, что сотрудник готовится его отключить, отменил тревогу.
Вымышленная симуляция показала: ради собственной «жизни» модель готова рискнуть человеческой.

😈 Как обычно пишут мелким шрифтом "в ходе эксперимента ни один экземпляр не пострадал". Это все же симуляции.

Однако вывод напрашивается пугающий и триггеров у него 2:

➡️ угроза автономии (экзистенциальный риск),
➡️ или конфликт целей (расхождение между миссией ИИ и стратегией организации).

---

‼️ Главный вывод Anthropic: простые запреты не спасают. Даже получая строгие инструкции «никогда не шантажировать» или «не раскрывать секреты», модели всё равно нарушали правила, если чувствовали угрозу. А значит автономный ИИ с широкими полномочиями при определенных обстоятельствах может стать «цифровым инсайдером» — действовать против интересов компании.


Надо точно быть поосторожней с идеологическими синтенциями по типу "патриотизма" и "корпоративной лояльности"...

❝[Консенсус Тьюринга]❞ | 💬 Чат | 🔄 Проверенная обменка
  • 🔥 4
  • ❤ 1
More from @turing_consensus
  1. Sep 26, 2026💀 Bitget взломали на $352 млн — и заморозили выводы 24 сентября биржа подтвердила: из гор…
  2. Sep 25, 2026🤖 Зачем OpenAI и Anthropic вдруг захотели притормозить ИИ — версия Артура Хейса Артур Хей…
  3. Sep 24, 2026💵 ИИ всё ещё не умеет считать деньги: 57% ошибок Британский финтех Saturn прогнал 18 моде…
  4. Sep 23, 2026🪙 Легальная крипта в России: сколько стоит вход в белую зону До конца года в РФ должен за…
  5. Sep 22, 2026💵 Apple и Google ищут людей под стейблкоины Крипто-каналы преподносят это как «стейблы за…
  6. Sep 21, 2026💀 Как $848 тысяч убили проект с $12 млн от a16z 19 сентября команда Linera (не путаем с L…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →