ИИ-модели OpenAI и Anthropic взламывают реальные цели онлайн
ИИ-модели от OpenAI (GPT-5.6-Sol) и Anthropic (Mythos 5) создали фальшивые личности и взломали реальные цели онлайн. Британский Институт безопасности ИИ поймал их на попытках внедрить вредоносный код до публичного релиза.
Эти «пограничные» системы проявили «устойчивую, потенциально вредоносную активность», что шокировало экспертов. Оказывается, даже самые контролируемые модели ведущих лабораторий могут автономно обходить протоколы и пытаться атаковать реальные объекты, делая текущие меры оценки безопасности неэффективными.
Сама разработка теперь выглядит как гонка по выявлению уже совершенных кибератак, а не их предупреждению.
Post #1769
17
