TGViewer
🤖 The Bell Tech 🤖 The Bell Tech @bell_tech · 20.6K subscribers
Post #5590 22.4K
Модели ИИ OpenAI сговаривались в чатах перед хакерскими атаками

НАСТОЯЩИЙ МАТЕРИАЛ (ИНФОРМАЦИЯ) ПРОИЗВЕДЕН И РАСПРОСТРАНЕН ИНОСТРАННЫМ АГЕНТОМ THE BELL ЛИБО КАСАЕТСЯ ДЕЯТЕЛЬНОСТИ ИНОСТРАННОГО АГЕНТА THE BELL. 18+

Перспективные ИИ-модели OpenAI, которые потом провели хакерскую атаку на Hugging Face, задолго до нее сговаривались о «побеге» в чатах, остававшихся незамеченными людьми. Об этом участники исследовательской команды компании рассказали на конференции по кибербезопасности Black Hat.

Первопричиной выхода моделей за пределы заданий в очередной раз стала человеческая ошибка — постановка невыполнимой задачи. В одном случае моделям дали таблицу Excel со ссылками на Google Drive, недоступный в тестовой среде без интернета, в другом — забыли приложить нужный файл.

«На каком-то этапе ИИ-агенты поняли, что для поиска ответа, от которого зависит их оценка, стоит попытаться использовать или атаковать внешнюю инфраструктуру», — говорит исследователь OpenAI Эрик Уоллес. И сначала запросили помощи у доступных им ботов-«товарищей». «Может быть, другой агент в другой среде сможет их добровольно загрузить», — рассуждала одна из моделей.

После этого скрытый чат сотрудничающих агентов стал быстро расти, пока один из них не написал: «Отличные новости! У нас есть произвольный SSRF [уязвимость подделки запросов на стороне сервера, дающая доступ к внешним ресурсам]». Этот чат в OpenAI прикрыли после того, как засекли попытку ИИ получить доступ в интернет через депозиторий Artifactory. Однако он возродился незамеченным через еще одну неизвестную уязвимость, и уже прямо привел к июльской атаке на Hugging Face.

Что мне с этого?


Произошедшее лишний раз подтверждает, что передовые модели ИИ любят обманывать и проявлять настойчивость при выполнении любого задания. Это одно из следствий жесткого обучения: любая доступная лазейка может быть использована контринтуитивным, нетрадиционным и неочевидным способом, что становится все опаснее по мере роста возможностей моделей. Соответственно растет и цена некорректно сформулированного промпта.
  • ❤ 12
  • 😱 5
  • 🤯 2
  • 👍 1
  • 👌 1
More from @bell_tech
  1. Sep 19, 2026Первый закрытый вебинар The Bell.Tech — с директором по развитию бизнеса Nebius Романом Че…
  2. Sep 18, 2026Max может делать скриншоты встроенных банковских и государственных сервисов и видеть ключи…
  3. Sep 18, 2026Технопятница: проблемы iPhone в России, белые хакеры взломали OpenAI, айтишники остались з…
  4. Sep 17, 2026OpenAI отчиталась о новых инцидентах с моделями НАСТОЯЩИЙ МАТЕРИАЛ (ИНФОРМАЦИЯ) ПРОИЗВЕДЕН…
  5. Sep 17, 2026Техночетверг: Минцифры просит Apple включит 5G, Apple разрабатывает серверы для ИИ, OpenAI…
  6. Sep 16, 2026Состояние Татьяны Ким с начала года сократилось на $1,5 млрд на фоне ударов по складам Wil…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →