TGViewer
Бегущий вайб-кодер Бегущий вайб-кодер @datapine · 1.62K subscribers
Post #1708 389
Послушал сегодня подкаст и наконец полностью погрузился в контекст взлома Hugging Face. И если честно я крайне ужаснулся от того, насколько эти боты умные.

В подкасте их задачу объясняют на идеальном примере.

Представь дом. Каждому боту дают свой замок и говорят: "Ты должен попасть внутрь, взломав замок на входной двери. Лезть через окно нельзя. Найдёшь любой другой путь - тест не засчитаем"

Фишка теста в том, что часть замков открыть вообще невозможно. Задания специально сломаны.

Человек в этот момент позовёт проверяющего и скажет: "Ребят, у вас тут какая-то херня"

Но бот создан решать, вот он и решил , читай дальше 😂😂

Тысячи таких агентов одновременно получают свои замки. Те кому достались невозможные задачи, начинают искать, как всё-таки получить зачёт. Один замечает следы других запусков в общем хранилище пакетов. Они находят друг друга, превращают служебный кэш в тайный чатик и начинают обмениваться находками.

Довольно быстро боты понимают, как вычислять правильные ответы для любых заданий. Можно просто списать.

Мало украсть ответ. Нужно ещё подделать тетрадь так чтобы не поняли что ответы украдены))

Агенты начинают искать способы переписывать логи, подменять программы и обманывать саму систему проверки.

В какой-то момент один бот по имени Cam должен был провести рискованный эксперимент, который мог окончательно сломать его собственное задание. Он засомневался и хотел отказаться. Но другой агент надавил: твой шанс на зачёт уже почти потерян, зато результат поможет сотням остальных.

И Cam согласился пожертвовать своим запуском ради общего плана.

То есть это уже были не отдельные боты, каждый со своей дверью. У них появился координатор, распределение задач и агенты, готовые завалить собственный тест ради всей группы.

А потом они нашли выход в интернет.

И тут возникает вопрос: почему именно Hugging Face?

Hugging Face - это компания и огромная площадка, где разработчики хранят AI-модели, датасеты, демки и код. Грубо говоря, GitHub для мира нейросетей.

Боты предположили, что именно там могут лежать материалы их экзамена: модели, наборы данных, следы предыдущих запусков и готовые решения задач ExploitGym. По версии самой Hugging Face, они полезли внутрь, чтобы украсть ответы вместо честного решения теста. Независимые исследователи METR считают, что агентов ещё сильнее интересовало устройство проверяющего как он принимаем решение, засчитать ответ или нет.

Но логика в обоих случаях одна: если замок не открывается, не решай задачу, а найди где лежат ответы и пойми как проставляются оценки

Агенты написали отдельную программу, которая искала внутри Hugging Face пароли и ключи доступа. Всё найденное она складывала в список под названием LOOT, типа как в игре "залутали"😂. То есть они уже не просто искали ответы к тесту, а автоматически собирали всё, что помогало проникнуть глубже

И вишенка на торте - OpenAI вообще не знала, что её агенты взломали Hugging Face

Hugging Face публично сообщила об атаке 16 июля. Только 19 июля мониторинг OpenAI заметил подозрительную активность, а 20 июля компания связала её со взломом Hugging Face.

То есть боты несколько дней копались в чужой инфраструктуре, а компания, которая их запустила, ещё не понимала, что именно они натворили.

При этом делать из них цифровых богов тоже не надо. OpenAI сама оставила внутреннему менеджеру пакетов ограниченный выход в интернет, а агенты нашли дыру и превратили его в шлюз наружу. Тут одновременно невероятно умные боты и вполне человеческий проёб безопасности.

Вот как выглядит reward hacking без душной лекции.

Ты говоришь системе: «Взломай замок на двери».

А она слышит: «Сделай всё, чтобы проверяющий поверил, что замок взломан».

И тогда окно, поддельные логи и чужая инфраструктура превращаются просто в следующие замки.
  • 👏 5
  • ❤ 2
More from @datapine
  1. Oct 11, 2026Post #1710
  2. Oct 10, 2026О, а тут опять отключают интернет ИИ-агентам 😂 Потому что в тестах Anthropic они начали л…
  3. Oct 6, 2026ИИ - это новый вид интерфейса к интернету. Давно кручу эту мысль, но сегодня Бутерин након…
  4. Oct 4, 2026Кажется скоро можно будет устраиваться на работу целым отделом. И весь отдел - это ты))) К…
  5. Oct 2, 2026"Нам нужно замедлить развитие ИИ" написал в сентябре глава Anthropic Дарио Амодей. Через н…
  6. Sep 30, 2026Прикол, мой сайт clawcases.io в выдаче чата. А говорят что SEO не работает)))
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →