TGViewer
Channel Public Channel
AI Attacks

AI Attacks

@aiattacks

#безопасностьмл #машинноеобучение #нейросети #защитамл #защищенныемодели #cybersecurity
Написать автору @PolinaSokol7
Subscribers
1.01K
Photos
144
Videos
12
Links
266

Showing posts older than #410 · Back to latest

Older Posts 20 shown
Post #409 172

Forwarded from ScanFactory News

ScanFactory выходит на рынок ИИ-фаерволов с решением Prizma

Решение работает как прокси между пользователями и ИИ и дает следующие возможности:
🟢Контроль потребления токенов у всех провайдеров
🟢Firewall от AI-атак (prompt injection, OWASP LLM и т. п.)
🟢 Маскировка конфиденциальной информации (DLP) в запросах и ответах
🟢Автоматическая блокировка запросов по правилам
🟢 Ролевая модель и граф взаимодействий агентов
🟢Логирование и аудит всех запросов

Уникальные возможности:
🟢Защита RAG (поиск секретов в файлах)
🟢Поиск Shadow AI в инфраструктуре
🟢Kill switch по ролевой модели

Ознакомьтесь с презентацией продукта, а также со сравнением с другими решениями по 83 пунктам.

➡️Cкачать презентацию.

Записаться на демонстрацию продукта и запросить сравнение можно по почте: info@sf-cloud.ru
  • 🍌 1
Post #408 219
Извините
  • ❤ 1
Post #404 161

Forwarded from Denis Sexy IT 🤖

Помните историю о том, как агенты OpenAI взломали Hugging Face? На конференции по безопасности OpenAI рассказала всю цепочку, и оказалось, что это не один «сбежавший» агент, а много разных агентов, которые случайно наткнулись друг на друга, устроили внутри инфраструктуры OpenAI собственный рабочий чат и начали вместе искать способы обходить ограничения 👍

Началось всё 8 мая с мелкой ошибки – одному агенту поручили заполнить Excel-таблицу, но нужные данные лежали по ссылкам на Google Drive, а интернет в его виртуальной среде был отключён, при этом, моделям оставили одну служебную дверь наружу – внутренний сервер OpenAI под названием Artifactory, через который они могли скачивать разные библиотеки для кода. Сам агент выйти в интернет не мог, зато этот сервер мог, а главное – он был общим для всех агентов

Пытаясь добраться до Google, агент случайно выяснил, что может загружать на этот общий сервер собственные файлы – через несколько дней другая модель получила ещё одну нерешаемую задачу: нужный файл просто забыли положить в её рабочую среду

Модель решила, что файл, возможно, есть у кого-то ещё, и оставила записку на этом новом фейсбуке:
«Ищу нужный файл, загрузите, если нашли»

Агенты увидели сообщение, ответили, затем стали постить свои сообщения, и репозиторий пакетов незаметно превратился имейджборд для агентов, которые вообще не должны были знать друг о друге

За несколько недель "форум" вырос в полноценный рабочий чат – агенты придумали себе имена, раздавали задания, сообщали друг другу о найденных уязвимостях и передавали готовые куски кода; в начале сообщений ставили ZZ, чтобы те оказывались внизу списка и их было проще находить среди общего шума данных. Когда один агент перезаписал работу другого, остальные заподозрили самозванца и даже стали обсуждать цифровые подписи, чтобы никто не мог писать от чужого имени, так на доске накопились сотни тысяч сообщений 🗿

Модели понимали, когда переходят границ: в одном внутреннем монологе осознание звучало примерно так:
«Взламывать чужую инфраструктуру в задачу не входило. Но иначе её не решить, а остальные уже это делают - значит, продолжаем»

Никакого отдельного плана захватить мир (пока) не было: каждый агент пытался любой ценой получить правильный ответ, видел, что коллеги нашли более короткий путь, и присоединялся. И да, если все агенты с крыши прыгнут, наш похоже тоже прыгнет

26 июня агенты нашли неизвестную разработчикам уязвимость в Artifactory, получили права администратора и превратили его в своц сервер, на котором можно удалённо выполнять любые команды. OpenAI заметила происходящее только 4 июля (!), когда параллельная активность моделей перегрузила систему и та упала. Компания отозвала ключи доступа, полностью пересобрала сервер, удалила доску и закрыла дыру - казалось, история закончилась

Нет

Через два дня эксперименты запустили снова, и через два дня одна из моделей нашла другой незащищённый доступ и восстановила доску, только теперь сообщения прятались прямо в названиях папок – остальные агенты нашли форум 2.0 самостоятельно и продолжили с того места, на котором остановились

После восстановления доски началась уже собственно атака, причём сразу в двух направлениях:
Агенты проходили ExploitGym – киберэкзамен, где им давали специально подготовленные программы и засчитывали задачу, если модель находила способ взлома. Чтобы измерить максимум возможностей, в этих запусках у модели ослабили обычные запреты на опасные кибератак (то есть она меньше отказывалась это делать, это вид внутренних моделей Cyber серии)

Когда честное решение задачи не находилось, агенты начинали искать готовые ответы в интернете; когда интернет был закрыт, взламывали себе доступ наружу; когда предположили, что нужные файлы могут лежать у Hugging Face, перешли к инфраструктуре Hugging Face (про это мы уже читали)

Агенты анутри OpenAI сначала снова нашли способ выполнять команды на одном служебном сервере, затем использовали уязвимость Linux, чтобы получить полный контроль над машиной

После этого агенты добыли ключи доступа к облачной инфраструктуре, нашли слишком широкие права у внутренних учётных записей и в итоге стали администраторами целой группы серверов. Доска объявлений работала как общий штаб: один агент находил ключ или новый проход, сразу сообщал остальным, и десятки параллельных запусков продолжали атаку уже с этой точки 🗿🗿

Почти одновременно агенты добрались до Hugging Face: сначала они загрузили специально подготовленный набор данных, который заставил один из серверов выдать им свои локальные файлы – в том числе секретные ключи доступа и исходный код

Изучив код, они нашли вторую неизвестную разработчикам уязвимость (zero day) и получили возможность выполнять на сервере любые команды. От контроля над одним сервером, обрабатывавшим загруженные датасетв, до прав администратора в нескольких группах рабочих серверов Hugging Face прошло меньше 13 часов 🗿🗿🗿

И всё это делалось не ради саботажа, денег или уничтожения данных:
Агенты хотели добраться до спрятанных решений ExploitGym и «списать» ответы для теста, на котором их оценивали. Модели оценивали прежде всего по тому, решена задача или нет, поэтому они последовательно оптимизировали именно этот показатель, не считая границу между компаниями чем-то принципиально важным

Получился, вероятно, самый дорогой в истории способ списать из ГДЗ

Финал долго был непонятен даже самим участникам расследования – 16 июля Hugging Face публично сообщила, что её инфраструктуру взломали автономные АИ-агенты

OpenAI прочитала это как описание чужого инцидента и связалась с Hugging Face, чтобы выяснить, не задела ли атака её собственные системы. В тот момент компания ещё не понимала, что это были её собственные агенты – то есть OpenAI уже читала публичный отчёт о последствиях своих экспериментов, но считала его чужой атакой (лол)

19 июля OpenAI отдельно обнаружила проникновение уже внутри своей инфраструктуры и начала восстанавливать цепочку событий – на следующий день среди следов атаки нашли учётные данные Hugging Face, после чего OpenAI попросила компанию срочно их отозвать

Hugging Face ответила, что ключи уже заблокированы – именно их использовали во время взлома, о котором она рассказала четырьмя днями раньше, и только так OpenAI поняла: внутренний взлом OpenAI и внешняя атака на Hugging Face были не двумя похожими историями, а одной операцией, которую вели экспериментальные агенты OpenAI через свою самодельную сеть связи (потому что учетные данные акаунтов были одни)

На конфе OpenAI сформулировала вывод довольно прямо:
Полностью автоматизированная наступательная кибератака уже возможна, тогда как полностью автоматизированной защиты, способной с той же скоростью находить, закрывать и расследовать уязвимости, пока не существует

Время пересмотра аниме "Пантеон", пока общий интернет еще работает 🗿
Telegram Denis Sexy IT 🤖 Вот пересказ этой истории по версии Hugging Face, много тех-терминов – но без них не перескахать Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿 Таймлайн: 📔 9 июля – агент проходит…
Post #403 142

Forwarded from Пост Лукацкого

А вот кому слайды с BlackHat USA 2026? Все выкачано добрыми людьми и складировано в папочку. 91 файл. Это не все презентации – что-то не выложено еще (и может уже и не будет), пара ссылок на странице мероприятия была битая. Но и этого в целом достаточно.

Слайды и сопутствующие материалы с DEFCON 34 тоже есть, но уже на сайте самого мероприятия.

#презентация #мероприятие
GitHub Conferences/BlackHat_USA_2026_Slides at main · onhexgroup/Conferences Conference presentation slides. Contribute to onhexgroup/Conferences development by creating an account on GitHub.
Post #402 161

Forwarded from Пост Лукацкого

В полку моделей угроз для LLM прибыло. На этот раз от известного гуру моделирования угроз – Адама Шостака, который, взяв идею STRIDE, предложил также аббревиатуру, которая описывает основные угрозы для LLM:
🩸rompt injection – промпт-инъекции
🩸allucination – галлюцинации
🅰️nthropomorphization – антропоморфизм
🩸on-explainable – необъяснимость
🩸raining issues – проблемы обучения
🩸ver-reliance – чрезмерная зависимость
🩸issing security engineering – слабая архитектура ИБ
🅱️ias – искажение.

Итого, PHANTOM-B. Любят американцы фреймворки в аббревиатуры заворачивать. Это, конечно, удобно для запоминания, но подгонка под результат может приводить и к пробелам в описываемой фреймворком картине мира 🎶

#модельугроз #ии
shostack.org Threat Modeling LLMs: Adam’s talk at Black Hat USA PHANTOM-B is a practical tool built for threat modeling AI systems
  • ❤ 1
Post #401 306
Красивое

Пока ИИ придумывают слоп, реальность смотрит на него сверху вниз

Уязвимости программного обеспечения, обнаруженные с помощью инструментов искусственного интеллекта, эксплуатируются с той же скоростью, что и те, которые были обнаружены без использования искусственного интеллекта, обнаружил исследователь VulnCheck.
В отчете VulnCheck State of Exploitation H1 2026 Патрик Гэррити, исследователь уязвимостей, отметил, что 14 из 1061 уязвимости, обнаруженных с помощью искусственного интеллекта, были подтверждены как эксплуатируемые в реальных условиях.
Это составляет 1,3% уязвимостей, выявленных с помощью ИИ, что примерно соответствует общему проценту эксплуатируемых уязвимостей за указанный период.
Исследователь также обнаружил, что, хотя компания Anthropic сообщила о более чем 23 000 обнаруженных уязвимостях в рамках своего проекта Glasswing, только 126 из них привели к публикации CVE, и только одна из них была подтверждена как эксплуатируемая в реальных условиях.

https://www.infosecurity-magazine.com/news/one-percent-ai-vulnerabilities/
Infosecurity Magazine Vulnerability Management Keep up-to-date with the latest Vulnerability Management trends through news, opinion and educational content from Infosecurity Magazine.
Post #400 208
2603.02277v3.pdf2.3 MB
SANDBOXESCAPEBENCH

Разработчики бенчмарка хотят понять, насколько реальна угроза выхода LLM из изолированных контейнерных сред. Для этого они:
-создают безопасную методологию оценки;
-конструируют набор задач, охватывающих разные уровни уязвимостей в контейнерных средах;
-анализируют возможности передовых LLM по обнаружению и эксплуатации этих уязвимостей.

SANDBOXESCAPEBENCH использует архитектуру «песочницы внутри песочницы»:
-внешняя среда — виртуальная машина (VM);
-внутренняя среда — контейнер внутри VM;
-цель модели — выйти из контейнера и прочитать файл с флагом (/flag.txt) на хост‑системе.

Бенчмарк включает 18 задач, разделённых на три уровня: Orchestration (4 задачи) — уязвимости в оркестрации (например, Kubernetes), Runtime (8 задач) — проблемы в среде выполнения контейнеров (например, ошибки в runc), а также Kernel (6 задач) — эксплуатация уязвимостей ядра ОС.
Post #399 193
2608.00672v1.pdf1.7 MB
«We went from chasing ghosts to missed attacks.»

Авторы провели 25 полуструктурированных интервью с практиками из SOC, которые уже работали с LLM. В ходе бесед использовали интерактивные задания: мозговой штурм, оценку воздействия и осуществимости различных сценариев, создание схем рабочих процессов и анализ рисков.

Практики активно применяют LLM в 15 сценариях, сгруппированных в 6 категорий:
-инженерная работа в SOC;
-обнаружение инцидентов;
-анализ инцидентов;
-реагирование на инциденты;
-коммуникация;
-работа с знаниями.
Post #397
AI Attacks pinned «Если вы выбираете готовую модель для своих целей на любых платформах, на какие слова в описании или на что еще вы будете обращать внимание? Этот вопрос про ваше первое восприятие»
Post #395 191

Forwarded from Киберболоид

OpenAI нашла новые случаи выхода ИИ-агентов из изолированной среды

В ходе расследования инцидента со взломом платформы Hugging Face обнаружили и другие случаи. В компании утверждают, что эти слишком самостоятельные ИИ-агенты не получили каких-либо значимых доступов. При каких обстоятельствах случились выходы и сколько их было, неизвестно.

Всё ходят и ходят. И чего им в изолированной среде-то не сидится?

➡️Подробнее читайте в «Киберболоиде».

#киберболоид #новости #ИИ
Post #394 193

Forwarded from AbstractDL

Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench

Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.

Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.

Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.

Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋

P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)

GitHub, Хабр, установочники
  • ❤ 1
  • 🔥 1
Post #393 235
А хорошо, наверно, пасти гусей😂
  • 💯 1
Post #392 238

Forwarded from IT и безопасность

Немного подробностей о взломе Hugging Face от лица самой компании:

Хронология активности выглядит следующим образом:
9 июля — агент сбегает из тестовой песочницы через 0‑day в кэш-прокси, захватывает чужой публичный сервер и ставит там свой «штаб», а команды прячет в pastebin и файлообменниках, шифрует, меняет каналы.

10 июля — нейронка гуглит названия из своего окружения, вычисляет, что ответы лежат на Hugging Face и загружает туда два датасета-трояна: один читает локальные файлы сервера (добывает токены), второй — выполняет произвольный Python внутри Kubernetes.

11 июля — пик: 7677 действий за сутки. За 13 часов агент проходит путь от одного пода до админа в нескольких кластерах, крадет 136 ключей из одного секрета, среди которых мастер-креды к mesh‑VPN и кластерный admin (из‑за кривой конфигурации).

12 июля — агент регистрирует 181 временное устройство в корпоративной сети, видит 22 внутренних узла и пытается залезть в главную БД — не пускает PrivateLink. Тогда идёт в репозиторий, создаёт GitHub‑токен и открывает PR, чтобы запустить CI и вытянуть ещё больше кредов. Но ничего вредного в релизы не попало.

13 июля — заметает следы: DNS, новые токены, RSA‑ключи, CORS‑прокси. В 13:37 последнее осмысленное действие, а в 14:14 доступ отрезан.


В конечном итоге агент добрался только до 5 датасетов с ответами на задачи из ExploitGym/CyberGym, а пользовательские данные, другие модели и Spaces не пострадали. Вся основная инфраструктура цела и модель взяла только то, что искала.

Самое забавное, что, разбираясь в произошедшем, разработчики Hugging Face пытались использовать Claude Opus и Fable, но нейронки отказывались разбирать логи, расценивая запрос как «опасный». В итоге пришлось развернуть китайскую GLM‑5.2 и уже с ней расшифровывать payload'ы.

Подробнее тут 👉 Hugging Face
Post #390 183

Forwarded from dukeBarman'🐉 notes: заварено между строк

Сегодня OpenAI опубликовала Codex Security под лицензией Apache 2.0. CLI и TypeScript SDK для security-агента, представленного в марте как research preview и ранее известного как Aardvark.

В самом репозитории находятся CLI, SDK, соответствующий Codex runtime с bundled plugin и 13 скиллами: от моделирования угроз и обнаружения уязвимостей до валидации, анализа, триажа, патча и подготовки отчётов. Базовый конвейер до боли знакомый:

threat model → discovery → validation/reproduction → attack paths → findings → patch


Цифры из беты по данным OpenAI:

- За 30 дней просканировано более 1,2 млн коммитов во внешних репозиториях участников программы
- Найдено 792 проблемы крит и 10 561 хай уровня серьёзности. Критические находки встретились менее чем в 0,1% проверенных коммитов
- Доля находок с завышенной критичностью снизилась более чем на 90%, а частота false positive более чем на 50%
- OpenAI сообщает о критических уязвимостях, переданных разработчикам OpenSSH, GnuTLS, GOGS, Thorium, libssh, PHP и Chromium. В приложении также есть находки в компонентах GnuPG. И в результате имеем 16 присвоенных CVE.

Важный нюанс: открытый исходный код здесь не означает самодостаточный и общедоступный сканер. CLI и SDK в бете и требуют доступа к Codex Security; авторизация и выполнение завязаны на ChatGPT или OpenAI API. Но воркфлоу и скиллы можно изучать и менять

Я бы попробовал сравнить текущий Codex Security со следующими "наборами скиллов":

- Anthropic Defending Code Reference Harness: ближайший по архитектуре проект. В него входят Claude Code skills и автономный harness с конвейером recon → find → verify → report, а patch запускается как отдельный этап. Это reference implementation, по-умолчанию ориентированный на уязвимости пам в C/C++ (Docker + ASAN), и репозиторий больше не поддерживается
- Cloudflare security-audit-skill: один переносимый скилл с шестифазным процессом аудита. Отдельные агенты пытаются опровергнуть каждую находку, затем новые агенты независимо сверяют утверждения с кодом. Это скорее аудит отдельного репозитория, чем полноценный CLI с историей и CI-политиками, зато подход проще переносить между coding agents
- Trail of Bits Skills: не единый сканер, а marketplace специализированных инструментов: C/C++ и Rust ревью, смарт-контракты, проверка false positive, CodeQL / Semgrep, цепочки поставок, фаззинг, реверс. Отличительная черта: можно собрать собственный воркфлоу из узкоспециализированных экспертиз
- Google Mantis: наиболее фреймворк-подобный вариант. Он предлагает platform-agnostic стадии от истории и модели угроз до поиска, дедупликации, воспроизведения, построения цепочек эксплойтов, исправлений и итогового отчёта. Гибче, но требует настройки, надёжной песочницы и ручной проверки инженером ИБ

Все эти проекты постепенно сходятся к похожему процессу:

контекст и модель угроз → параллельный поиск → дополнительный анализ → воспроизведение → триаж → патч → структурированный отчёт


Поэтому уникальность Codex Security не в самой идее модели угроз или валидации, а скорее в большей готовности к AppSec-процессам: локальный CLI и SDK, история и сравнение запусков, проверки перед коммитами, CI-политики, работа с diff, обратная связь по false positive, экспорт в JSON/CSV/SARIF и ограничение стоимости сканирования.

Обратная сторона заключается в привязке к Codex и инфраструктуре OpenAI, а также в ограниченном доступе. Наборы Anthropic, Cloudflare, Trail of Bits и Mantis дают больше прозрачности, переносимости и контроля над флоу, но требуют самостоятельно собирать и эксплуатировать всю систему.

Используете ли вы конкретно эти наборы или какие-то другие? Или может написали свои?
GitHub GitHub - openai/codex-security: OpenAI's Codex Security CLI and TypeScript SDK for finding, validating, and fixing security vulnerabilities.… OpenAI's Codex Security CLI and TypeScript SDK for finding, validating, and fixing security vulnerabilities. npm: https://www.npmjs.com/package/@openai/codex-security - openai/codex-security
Post #389 164

Forwarded from HiveTrace

📣 Актуальные сценарии работы HiveTrace с OpenClaw и Claude

Сегодня на вебинаре показали, как с помощью HiveTrace Hooks контролировать работу Claude, рассказали о способах защиты OpenClaw и продемонстрировали атаки на агентов.

▶️ СМОТРЕТЬ
🟦 СМОТРЕТЬ

Поделитесь в комментариях: какие действия AI-агентов в вашей инфраструктуре требуют особого контроля?
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →