Нейросети взламывают нейросети. Мы что, в симуляции?
В сети расходится вирусный тейк: якобы новейшую Claude Opus 4.8 взломали через 7️⃣ минут после релиза. Причём сделала это предыдущая версия (Opus 4.7) — просто скармливала «восьмёрке» выдуманные обрывки из учебников и просила их продолжить. В итоге ИИ выдавал гайды по отмыванию денег и созданию культов.
Спойлер: по неподтверждённым данным, это абсолютный фейк. Anthropic ещё даже не анонсировала эти версии.
Но дыма без огня не бывает. Механика model-on-model jailbreak — суровая реальность мая 2026 года. Свежие исследования (например, фреймворк PLAGUE) доказывают, что ИИ-агенты успешно ломают реальные Claude Opus 4.1 и OpenAI o3.
Атакующая нейросеть маскирует вредоносный промпт под безобидные инструкции (те самые «продолжения текстов» или вызовы функций), пробивая защиту в 81.4% случаев.
Пока мы смеемся над мемами, LLM уже вовсю учатся обманывать друг друга.
#AI #LLM #cybersecurity #AIAgents
Daily Papers
Post #484
67

- ❤ 2
- 👍 1
- 👏 1
- 😁 1