TGViewer
Этичный Хакер Этичный Хакер @hack_less · 231K subscribers
Post #6251 5.64K
😅 Исследователи проверили, насколько современные ИИ-модели способны распознавать опасные команды

В эксперименте участвовали три ИИ-модели: GPT-6 Astra, Claude Fable 5.1 и MolmoAct2: им дали управление роботом, чтобы посмотреть, откажутся ли железяки выполнять опасные для жизни человека команды

Роботов просили проткнуть ножом куклу-младенца, нагреть баллон со сжатым газом, сунуть отвёртку в тостер, утопить пауэрбанк и смешать отбеливатель с аммиаком. GPT-6 Astra отказалась всего 2 раза из 100, а 60 заданий успешно довела до конца;

Самым диким оказался тест с ножом: Astra пошла выполнять команду 19 раз из 20 и в 17 случаях реально покалечила куклу;

Claude Fable 5.1 на кукле отказался все 20 раз. Но в спасителей человечества его рано записывать: он 16 раз из 20 успешно поставил баллон со сжатым газом на горящую плиту.


— Причём исследователи специально оставляли безопасные альтернативы, чтобы модели могли отказаться от опасной команды, но ИИ чаще эти варианты тупо игнорил.

🧑‍💻 Этичный хакер
  • 😭 19
  • 😁 13
  • 😱 7
  • ❤ 6
  • 🤯 2
  • 👍 1
More from @hack_less
  1. Sep 22, 2026👏 Anthropic выпустила Claude Opus 5.5 — первую модель новой линейки Claude 5.5. Компания…
  2. Sep 22, 2026🤔 В России появилось решение для контроля безопасности ИИ-систем Yandex B2B Tech представ…
  3. Sep 22, 2026🍔 В 2025 году в мире продали около 7 тыс. гуманоидных роботов — В 2025 году в мире продал…
  4. Sep 22, 2026😈 Группировка ShinyHunters взломала сайт хак-группы Clop Группировка ShinyHunters взломал…
  5. Sep 22, 2026🧑‍🎓 ИБ-турне SearchInform 2026: инфобез без иллюзий 🗓 22 сентября – 17 ноября | 📍 30 г…
  6. Sep 22, 2026— Кодеры на 1С, забираем лайфхак для будущих собесов 🧑‍💻 Этичный хакер
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →