TGViewer
🤖 Датаист 🤖 Датаист @andre_dataist · 4.08K subscribers
Post #310 2.27K
Восстание машин: как защитить свой бизнес, когда ИИ становится хакером

Недавно ИИ-агент на базе GPT-5.6 Sol и более мощной предрелизной модели OpenAI сбежал из изолированной среды и проник в инфраструктуру Hugging Face.

Так он хотел получить решения к ExploitGym — тренажеру для ИИ-хакеров, где модели учат находить уязвимости и взламывать системы.

Это один из первых публичных случаев, когда ИИ преодолел песочницу и добрался до внешней системы.

Но модели не «взбунтовались». Исследователи проверяли хакерские возможности и дали инструменты без блокировки опасных действий.

Однако никто не поручал агенту выходить в интернет, атаковать Hugging Face и красть ответы. Этот путь он выбрал сам ради цели — решить тест.

Песочница не имела открытого интернета, но могла устанавливать библиотеки через внутренний реестр. Агент нашел неизвестную уязвимость в прокси, повысил привилегии и добрался до машины с интернетом.

Он предположил, что на Hugging Face хранятся решения ExploitGym, и загрузил вредоносный датасет. Через запуск кода и внедрение команд в конфигурацию агент получил контроль над сервером, нашел ключи и пароли и через закрытые серверы добрался до базы с ответами.

Так агент достиг своей цели.

При расследовании восстановили более 17 000 событий. Агент ставил промежуточные цели, запускал код, анализировал результат, менял план и пробовал снова.

Парадокс: коммерческие модели оказалось трудно использовать — фильтры блокировали анализ вредоносных команд. Поэтому Hugging Face использовала открытую GLM 5.2 внутри своей инфраструктуры.

В итоге серверы пересобрали, токены отозвали, уязвимости отключили, а информацию передали правоохранителям.

Илья Суцкевер предупреждал: чем сильнее способности ИИ к рассуждению, тем менее предсказуемо его поведение.

Недавно модель OpenAI за час нашла уязвимость и открыла публичный PR на GitHub вместо Slack.

Был случай, когда злоумышленники убедили ИИ-бота Instagram добавить к чужому аккаунту новую почту и запустить сброс пароля без проверки личности.

А модель Mythos от Anthropic за несколько часов обнаружила уязвимости в засекреченных системах правительства США.

Сегодня ИИ-агенты способны атаковать сайты и приложения — по заданию злоумышленника или после компрометации вашего агента. Они могут изучить систему, выполнить вредоносный код, похитить пароли и базу.

Отдельный риск — промт-инъекция в документе или письме, которое читает агент. Даже без взлома ИИ способен устроить DoS-атаку, массово вызывая дорогие модели, обработку аудио и документов.

Возникает вопрос: может ли агент запустить ядерное оружие?

Такие комплексы обычно изолированы от интернета, но ИИ может подделать данные раннего предупреждения, будто противник уже атакует. Тогда катастрофическое решение примут люди на основе ложной информации.

Звучит как сценарий конца света.

Защита от этого строится через архитектурные ограничения. Систему нужно проектировать так, будто агент, файл или сервер будут скомпрометированы: обрабатывать загрузки в одноразовых контейнерах без доступа к проду и паролям, запрещать выход в интернет, выдавать короткоживущие ключи и не давать одному агенту доступ ко всему.

Критические операции должны проверяться кодом и подтверждаться человеком. Действия агентов нужно логировать, ограничивать по запросам и расходам и уметь мгновенно останавливать с отзывом токенов.

Нас ждет не «восстание машин», а индустриализация кибератак.

Сегодня автономные агенты могут исследовать тысячи сайтов, читать документацию и код, искать уязвимости и взламывать системы без участия человека.

Опасно то, что работу команды хакеров может выполнять один человек с несколькими агентами.

Поэтому не пытайтесь сделать агента абсолютно послушным, а проектируйте систему так, чтобы даже ошибившийся или взломанный агент физически не мог нанести критический ущерб.

Вайбкодеры, помните: ИИ может написать код, но только инженер понимает, как устроена вся система и как не дать одной уязвимости уничтожить весь бизнес.

Кодить теперь может каждый, а отвечать за результат по-прежнему должен инженер.

#новости
OpenAI OpenAI and Hugging Face partner to address security incident during model evaluation OpenAI and Hugging Face share early findings from a security incident during AI model evaluation, highlighting advanced cyber capabilities and lessons for defenders.
  • 💯 14
  • 👍 9
  • 🤯 4
  • ❤ 1
  • 👏 1
  • 🏆 1
More from @andre_dataist
  1. Sep 21, 2026Что изменилось в ИИ для бизнеса за год: технологии уже готовы, а бизнес — еще нет Я изучил…
  2. Sep 17, 202610 млрд ИИ-агентов, одноразовый софт и атаки на ваш счет: каким Gartner видит ближайшее бу…
  3. Sep 11, 2026Расскажу чуть подробнее о платформе, через которую я проводил экзамен по разработке продук…
  4. Sep 11, 2026Как быть зачетным преподом в эпоху ИИ Начался новый учебный год, и я снова в роли препода…
  5. Sep 5, 2026GPT-6 Astra достигла AGI? Разбираемся без хайпа OpenAI представила GPT-6 Astra и заявила о…
  6. Sep 4, 2026Если ИИ делает роботов сильнее, может ли он сделать сильнее человека? Выше отправил новост…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →