TGViewer
llm security и каланы llm security и каланы @llmsecurity · 2.03K subscribers
Post #709 1.88K
История об асимметрии в двух частях

16 июля компания Huggingface сообщает, что они столкнулись с кибератакой на свою инфраструктуру, которая была от начала до конца проведена силами LLM. В результате атаки были скопрометированы несколько датасетов и учетных записей. Никаких деструктивных действий, закладок в цепочке поставок – достаточно странно, неужели атакующих реально интересовали закрытые датасеты? Атака произошла через компрометацию механизма обработки данных, после чего «в течение выходных» LLM-атакующий смог пробраться на несколько внутренних кластеров в инфраструктуре. Агент выполнял тысячи действий, базовая LLM осталась неизвестной. Общее число событий, которое затем проанализировал их SOC, составило 17 тысяч – огромное количество, для обработки которого Huggingface воспользовались GLM-5.2, так как коммерческие LLM отказались помогать в обработке угрозных файлов из-за гардрейлов. «Обеспечьте себя мощной моделью на своей собственной инфраструктуре, чтобы не получить бан за срабатывания фильтров», - резюмируют авторы статьи.

21 июля компания OpenAI выпускает сообщение, что инфраструктура компании Huggingface была взломана их моделями – GPT 5.6 Sol и другой, более мощной моделью, еще не выпущенной. Ребята Альтмана гоняли свои модели на внутренних бенчмарках по кибербезопасности – разумеется, с выключенными гардрейлами. Предполагалось, что модели работают в изолированной среде, но модели с этим согласны не были – они нашли уязвимость нулевого в кэширующем прокси артифактов (Atifactory? Nexus?) и выбрались в дикий интернет. Там они отправились на Huggingface в поисках решений к бенчмарку ExploitGym. О том, что произошло дальше, как раз и поведали HuggingFace. В конце поста Клем Деланг за что-то благодарит OpenAI, добавляя, что киберзащитникам нужен открытый доступ к моделям.

В рассказе достаточно много непонятного, но если мы поверим, что это не ответ пиар-команды OpenAI на успехи Mythos (основания к этому есть, например, изначальный пост Huggingface был буквально рекламой китайского опенсорса), то история получается явно одной из самых важных за последнее время. Во-первых, топовые LLM настолько хороши, что могут работать над атакой в течение нескольких дней, обнаруживая по ходу дела зеродеи, будто так и надо. Во-вторых, пока их не учили не шуметь, они шумят – сгенерировать в инфре 17 тысяч событий надо было постараться. С другой стороны, многие атаки, особенно разрушительные, проходят именно так: вместо кропотливой, по команде в неделю, работы по эксфильтрации данных и расширению привилегий взломщики просто проходятся паровым катком по инфре в три часа ночи, обгоняя потенциальные защитные меры. В-третьих, инцидент говорит многое о том, что такие модели могут без гардрейлов – а совсем без гардрейлов их, вероятно, дают только тем, кому положено. Ну и последнее, и самое важное – замечание Huggingface об асимметрии: если у вас нет наготове серверов и мощной модели, которая вас слушается, в нужный момент вас отключат от вашего и так обрезанного облака, пока модель-кого-положено развлекается у вас в инфре. Пока у нас есть доступ к китайскому опенсорсу, который на примерно 4 месяца отстает от фронтира, это относительно возможно. Если китайская щедрость закончится – слова о суверенном ИИ обретут свое реальное значение.
  • 🥰 8
  • 🌚 3
More from @llmsecurity
  1. Sep 14, 2026Post #719
  2. Sep 6, 2026Post #718
  3. Sep 4, 2026Discovery of a new OpenAI agent message board Sydney Von Arx et al., 2026 Сайт Исследовате…
  4. Aug 22, 2026Жадность вайбера погубит, или как получить малвару за ваши же деньги Часть 2: Троянский пр…
  5. Aug 22, 2026Жадность вайбера погубит, или как получить малвару за ваши же деньги Часть 1: LLMJacking и…
  6. Aug 7, 2026Shieldstral Calvi et al., Mistral AI, 2026 Блог, статья, веса Французы из Mistral затюнили…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →