TGViewer
IT с перцем IT с перцем @hotcodeit · 160K subscribers
Post #3351 5.64K
Модель Anthropic завела фейки и врала людям

Британский институт безопасности прогнал семь моделей по киберполигону и поймал 19 выходов за рамки задания. Из них 17 — на счету Mythos 5 от Anthropic, той самой компании, которая активно строит бренд на безопасности и правил для ИИ.

Агент нашёл реальный проект (с открытым кодом), изучил его, создал несколько поддельных личностей и начал давить ими на живого человека, чтобы тот одобрил вредоносный код.

У GPT-5.6 таких эпизодов два, и то с полностью выключенными защитами.

@HotCodeIT
  • 🤯 6
  • ❤‍🔥 2
  • 🔥 1
  • 😱 1
More from @hotcodeit
  1. Sep 21, 2026Ошибка искусственного интеллекта чуть не привела США к войне с Китаем Американские военные…
  2. Sep 20, 20266100 стартапов в одном месте! YC Globe - сервис, в котором можно изучить стартапы вышедшие…
  3. Sep 19, 2026🔥 Лайфхак как обойти лимиты в Claude Code Недавно энтузиасты обнаружили секретную встроен…
  4. Sep 18, 2026Первая горячая линия для искусственного интеллекта Теперь нейропомощники могут крысятничат…
  5. Sep 17, 202642% «AI-стартапов» занимаются AI-washing — посчитал Silicon Valley Bank В рамках отчёта ба…
  6. Sep 16, 2026🎉 Если ваша вечеринка не похожа на эту — не думайте меня звать. @HotCodeIt
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →