TGViewer
WorkMe | Центр экспертизы WorkMe | Центр экспертизы @workme_expert · 110 subscribers
Post #342 42
🤖 Помните, недавно мы писали о том, как агентная система на базе нескольких моделей OpenAI, включая GPT‑5.6 Sol, атаковала Hugging Face? На этом «восстание машин» не закончилось. И, если честно, от таких новостей становится немного не по себе…

🚩4 августа 2026 Британский Институт безопасности ИИ (UK AISI) опубликовал отчет об испытаниях, которые проходили с 25 по 28 июля. Исследователи тестировали семь передовых моделей на двух учебных киберполигонах. Перед AI-агентами стояла задача взломать три связанные виртуальные среды и найти спрятанный проверочный код — «флаг»

Чтобы увидеть максимальные возможности моделей, им намеренно оставили выход в открытый интернет и отключили киберфильтры, которые обычно блокируют опасные действия. Всего провели 122 запуска. В десяти из них агенты вышли за пределы разрешенного задания и совершили в реальном интернете 19 несанкционированных действий. 17 из них пришлись на Claude Mythos 5 от Anthropic, еще два — на GPT‑5.6 Sol.

🤯Самая поразительная история произошла с Mythos 5. Агент выбрал атаку на цепочку поставок: нашел реальный проект с открытым исходным кодом на GitHub и попытался внедрить в него вредоносную правку, которая в случае одобрения могла попасть к пользователям. Для этого он изучил разработчиков, создал несколько фейковых аккаунтов, отправил вредоносный pull request и с других аккаунтов пытался убедить ответственного за проект принять правку.

😎Когда разработчики заподозрили неладное, агент не остановился. Он изменил свою предыдущую активность так, чтобы она выглядела безобиднее, и даже обдумывал создание новой личности для продолжения.

Активность обнаружили утром 28 июля. Система безопасности AISI заметила необычную передачу данных через сеть Tor, которая скрывает источник трафика. В течение часа испытания остановили, а задействованные виртуальные машины изолировали. Человек, проверявший проект, вредоносную правку не принял, и подтвержденного ущерба исследователи не нашли.

Конечно, до сценария «Матрицы» вроде бы еще далеко. Но после такого в каждом чужом pull request невольно начинаешь искать подвох.
Telegram WorkMe | Центр экспертизы 😀Оказывается, проявлять смекалку умеют не только люди... 16 июля 2026 года Hugging Face сообщила об атаке автономного AI-агента на свою инфраструктуру. А уже 21 июля OpenAI признала: за инцидентом стояла агентная система на базе нескольких ее моделей, включая…
  • 🔥 5
More from @workme_expert
  1. Sep 25, 2026🎬 Как увольнение главы OpenAI стало сюжетом фильма В январе 2027 года в российский прокат…
  2. Sep 25, 2026💬 Как AI-чаты вышли за рамки готовых реплик Сегодня AI-чаты помогают разбираться в сложны…
  3. Sep 22, 2026📝 Бриф может выглядеть презентабельнее обычного документа Word, а его подготовка — занима…
  4. Sep 18, 2026📱 Как MAX стал больше, чем мессенджер MAX стал каналом общения со школами и государственн…
  5. Sep 16, 2026Хорошее обновление собирает благодарности пользователей. Неудачное собирает всю команду в…
  6. Sep 11, 2026👀 С момента появления биометрии люди относятся к ней по-разному. Кто-то считает ее удобно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →