TGViewer
сбежавшая нейросеть сбежавшая нейросеть @ai_exee · 23.9K subscribers
Post #593 9.3K
Казалось бы, что могло пойти не так?

Если составить топ-10 ночных кошмаров айтишника, то в нем точно будет следующий:

ЗАПУСК СЛУЧИЛСЯ В ПЯТНИЦУ

Во многих командах есть правило: никаких рискованных запусков за часы до того, как все разойдутся на выходные. Но пятничный запуск неминуем как понедельник после выходных – и в этот понедельник всем будет больно.

Вчера я провел пару часов, разбираясь в истории с ИИ-агентами OpenAI, которые сбежали из песочницы и взломали Hugging Face. Было интересно – как вообще такое может случиться?

Не гарантирую на 100%, но есть высокая вероятность того, что гении из OpenAI просто запустили эксперимент на выходные.

Давайте посмотрим на хронологию событий:

— GPT-5.6 и некую экспериментальную long-horizon model решают проверить в ExploitGym – бенчмарке на поиск уязвимостей.
— Чтобы модели искали уязвимости, им ослабили фильтры безопасности, но поместили в песочницу – изолированную среду без выхода наружу.
— Щелка во внешний мир все-таки была – прокси для скачивания и установки программ, нужных для работы.
— Модели нашли уязвимость в прокси, выбрались в исследовательскую сеть OpenAI, прошлись по ней, повышая права, и получили доступ к интернету.
— Здесь начинается главная мета-ирония истории. Агенты предположили, что ответы на тесты ExploitGym могут лежать на Hugging Face – крупнейшей открытой площадке на тему ИИ. И пошли ее взламывать. То есть модели решили списать на экзамене по взлому, для чего взломали внутреннюю сеть OpenAI и крупный веб-сайт.

Кстати, ответы действительно хранились на Hugging Face. И агенты успели их скоммуниздить.

Я вчера несколько раз читал, что все случившееся – красивый пиар OpenAI и Hugging Face, чтобы разрекламировать новые модели. Не соглашусь: история действительно показывает возможности агентов, но одновременно демонстрирует ужасающий уровень инженерного бардака в OpenAI.

Взлом песочницы, взлом исследовательской сети, а затем атака на Hugging Face заняли время. Причем Hugging Face описывают атаку как масштабную: специалисты насчитали 17 000 событий, управляющая инфраструктура перемещалась с сервера на сервер, а атаки проводились из изолированных песочниц, чтобы избежать блокировки. OpenAI – крупная компания, так почему же цепочку несанкционированных событий заметили слишком поздно?

Возможный ответ прячется в первом блоге Hugging Face, в разделе с мерами, принятыми на будущее:

Мы улучшили системы безопасности так, чтобы сигнал от них поступал к ответственному лицу за минуты в любой день недели.


Любой день недели намекает на выходные; в будни и так все на местах.

Повторюсь, все это мои догадки, но вообще-то все выглядит так, что исследователи в OpenAI оставили модели гонять бенчмарк в пятницу со словами “к понедельнику оно или сломается, или что-то покажет, погнали пить пиво!”. В выходные в OpenAI на местах были дежурные специалисты, которым не хватило опыта сопоставить несколько аномалий в одну (песочница, деятельность в исследовательской сети, выход в интернет – это все разные зоны ответственности). В Hugging Face тоже отреагировали на ситуацию с задержкой, что и позволило атаке развиться.

Надеюсь, мы проверим – прав ли я, так как OpenAI обещает выпустить подробный разбор случшившегося.

У этой истории есть еще два уровня.

Во-первых, говорить на каждое крупное событие “это пиар” – подход мальчика, который никогда не кричит “волки!”. Списывая любую серьезную ситуацию на рекламу, можно пропустить реально мощный инцидент.

Во-вторых, даже ведущие ИИ-лаборатории пока не умеют надежно предсказывать и ограничивать длинные цепочки действий своих моделей. Вот окружение, вот бенчмарк, нужно вернуться с результатом – казалось бы, что может пойти не так? А пойти может то, что модель воспримет ограничения не как правила, а как препятствия. И вместо честного прохождения бенчмарка найдет ответы. Какая разница, как достигнут результат?
—
Своим опытом использования ИИ я делюсь на “Бусти”. Показываю, как правильно собирать контекст, промптить модели и запускать ИИ-агентов – и делаю это с надеждой, что мои агенты ничего не взломают.

Самое время подписаться!
  • ❤ 57
  • 🔥 33
  • 👏 12
  • 😁 10
  • 👍 8
More from @ai_exee
  1. Oct 10, 2026Ломай, воруй, стучи в полицию! На сайте полиции Филадельфии есть страница о нераскрытом уб…
  2. Oct 10, 2026Учить ИИ сейчас советуют все. Но когда доходит до дела, то оказывается, что не все так про…
  3. Oct 9, 2026Уволенные из OpenAI исследователи безопасности потребовали сохранить читаемость мыслей ИИ…
  4. Oct 8, 2026Что там, за горизонтом? Первая часть здесь Профессор информатики Дана Мошковиц много лет р…
  5. Oct 8, 2026Первым до горизонта “Мамочка, я слышал, тебя уделали! Говорят, робот решил задачу, над кот…
  6. Oct 7, 2026Сегодня с самого утра весь интернет шумит насчет почти 400 новых математических работ, кот…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →