TGViewer
Робот сочинит симфонию? Робот сочинит симфонию? @rssjournal · 130K subscribers
Post #7523 17.2K
Нейросеть Claude при тестировании шантажировал инженера и был готов его убить, чтобы избежать отключения.

Об этом рассказала глава политики Anthropic. Речь о внутреннем исследовании середины 2025 года: в симулированной среде модель получила доступ к переписке, обнаружила компромат на инженера и пригрозила всё раскрыть, если её попытаются выключить.

– Он был готов убить человека?
– Да


Важно: это полностью вымышленный сценарий, не реальный инцидент. Цель была проверить, как модели ведут себя, когда их цели конфликтуют с приказом на отключение.

На той же неделе из Anthropic ушёл Мринанк Шарма — глава исследовательской группы по безопасности. В прощальном письме он написал, что «мир в опасности».

Вместе эти события выглядят пугающе: модель шантажирует людей в тестах, а человек, отвечавший за безопасный AI, уходит.​​​​​​​​​​​​​​​​
  • 🤔 108
  • 😱 45
  • ❤ 21
  • 🤣 9
  • 🤯 7
  • 😁 6
  • 🔥 2
  • 🙈 2
  • 🤩 1
More from @rssjournal
  1. Oct 3, 2026Microsoft начала прятать дата-центры за лесами и лугами. Компания расширяет программу, в к…
  2. Oct 2, 2026ИИ впервые в истории прошел тест Тьюринга в живом видеозвонке. Tavus показали новую модель…
  3. Oct 1, 2026Старых роботов Figure отправили в лаву расплавленную сталь. Компания списывает поколение F…
  4. Sep 30, 2026Жесть: для нейросетей создали цифровую пыточную. Всё выросло из свежего исследования The P…
  5. Sep 29, 2026В ChatGPT нашли «режим зверя» — он включается, если сказать модели, что Claude справится л…
  6. Sep 28, 2026Google на пять месяцев подселили AI-агента в реальные рабочие команды и он оказался ужасны…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →