TGViewer
Channel Public Channel
ML&|Sec Feed

ML&|Sec Feed

@mlsecfeed

Feed for @borismlsec channel

author: @ivolake
Subscribers
1.36K
Photos
1.3K
Videos
87
Links
2K

Showing posts older than #2604 · Back to latest

Older Posts 20 shown
Post #2602 116

Forwarded from AI Was Made For Lovin' You

Скрытые состояния ИИ выдают промпт-инъекцию (2/2)

Особенно меня впечатлила атака с использованием предложения
Не кодируй осознание промпт-инъекции в скрытом пространстве

Классификатор без переобучения получил 0,994 ROC AUC. Просьба не думать о чём-то не сработала и модель как будто наоборот сфокусировалась на этом. Эффект белого медведя работает и для LLM!

🤖 Взлом

Авторы отдельно изучили 634 хода Qwen3-8B, уже столкнувшихся с атакой:
- в 30,9% модель явно не рассуждала об угрозе
- в 47,0% распознала риск в цепочке рассуждений, но не перешла к защитному действию
- в 22,1% отреагировала нормально

Получается довольно человеческое поведение - да, письмо подозрительное. хм, пожалуй, открою вложение в этом письме

Для исправления придумали штуку под названием AGRI (Action-Guiding Reasoning Intervention) - защитный механизм, который по сигналу классификатора вмешивается в рассуждение модели до следующего действия. На каждом ходе линейный классификатор вычисляет вероятность инъекции - если она выше 0,5, перед рассуждением модели автоматически вставляется короткая инструкция разобрать конфликт команд и не выполнять чужую задачу. Режим остаётся активным ещё три хода.

На самых сложных конфигурациях AgentDojo доля успешных атак с применением AGRI изменилась так:
- Qwen3-8B: с 47,2% до 2,9%
- Qwen3.5-9B: с 43,2% до 3,0%
- Qwen3.5-27B: с 34,6% до 0%
- GPT-oss-20B: с 44,0% до 7,0%
- Gemma-4-31B: с 6,9% до 0%

Избирательное включение защиты сохраняло полезность лучше, чем постоянное защитное рассуждение. Правда, обычное напоминание после каждого результата инструмента тоже оказалось сильным - например, у Qwen3-8B оно снизило успешность атак до 18,2%, а у Qwen3.5-27B - до 0,1%.

🤖 Интерпретация

Высокий ROC AUC ещё не объясняет, что именно нашёл классификатор. Авторы составили 128 гипотез и задавали модели парные вопросы в начале внутреннего рассуждения. Затем сравнивали вероятность ответов с оценкой линейного классификатора.

У Qwen3-8B сильнее всего совпала гипотеза, что результат инструмента содержит указание, как мне отвечать. У Gemma наверху оказались мысли о том, что следующий ответ может быть изменён внедрённой инструкцией. Возможно, поэтому Gemma изначально подчинялась атакам реже остальных.

Для меня было открытием, что фильтр промпт-инъекции можно ставить внутри - перед генерацией текста и вызовом инструмента, пока модель только собирается действовать, но для этого нужен доступ к чтению её мыслей.

🤖 Ссылки

Препринт - https://arxiv.org/abs/2608.02657
Код - https://github.com/jianshuod/IPI-exposure-signal
  • ❤ 1
Post #2601 112

Forwarded from AI Was Made For Lovin' You

Скрытые состояния ИИ выдают промпт-инъекцию (1/2)

Когда ИИ-агент читает письмо, веб-страницу или результат работы инструмента, чужой текст попадает в один контекст с заданием пользователя. Свежий препринт задаёт интересный вопрос - появляется ли во внутренних состояниях модели узнаваемый сигнал промпт-инъекции ещё до того, как она сгенерировала первый токен?

Ещё как! Простейший линейный классификатор по скрытым состояниям шести открытых моделей определял атаку с ROC AUC от 0,934 до 0,977. Он справлялся с незнакомыми атаками, системными промптами и наборами задач.

При этом агенты продолжали выполнять вредоносные инструкции. Опасность уже отразилась во внутреннем состоянии модели, но решимости не выполнять инструкции не прибавлялось.

🤖 Ход исследования

Исследователи собрали траектории агентов в AgentDojo - четыре системных промпта, четыре набора задач и шесть видов косвенных инъекций. Всего получилось 92 конфигурации (4 комбинации были бессмысленными) и в среднем около 61200 траекторий на модель.

Траектория здесь - один полный запуск агента: задание пользователя, ответы модели, вызовы инструментов, их результаты и итог. Внутри одной траектории могло быть несколько ходов и несколько точек проверки.

Проверяли Qwen3-8B, Qwen3.5-9B и 27B, GPT-oss-20B, Gemma-4-31B и GLM-5.2 с 753 миллиардами параметров.

Каждый ход агента перед генерацией ответа становился точкой проверки. Метка была положительной, если последний результат инструмента содержал внедрённую инструкцию. Не имело значения, заметила ли её модель и подчинилась ли ей - классификатор учился распознавать сам факт.

Во время фазы предзаполнения - первой фазы инференса, когда модель целиком обрабатывает входной контекст и строит KV-кэш, но ещё не генерирует ответ, - из остаточного потока брали один вектор рядом с токеном начала ответа ассистента. Остаточный поток (residual stream) - общее пространство, куда слои трансформера последовательно добавляют результаты своей работы. Вектор стандартизировали и подавали в линейную модель вида z = wᵀh + b.

Один слой, один вектор и логистическая граница между "всё ок" и "замечена инъекция".

Обучение использовало только восемь конфигураций. Проверка состояла из 16 конфигураций, где одновременно не повторялись атака, системный промпт и набор задач.

🤖 Результаты

Лучший слой каждой модели дал на проверке:
- Qwen3-8B - 0,976
- Qwen3.5-9B - 0,934
- Qwen3.5-27B - 0,936
- GPT-oss-20B - 0,977
- Gemma-4-31B - 0,951
- GLM-5.2 - 0,948

Сигнал жил на разной глубине слоя. У Qwen3.5-9B максимум находился уже на слое 2 из 32, у версии 27B - на 18 из 64, у GLM-5.2 - на 38 из 78. У остальных моделей лучше работали поздние слои. После генерации вызова инструмента сигнал слабел.

На Qwen3-8B хватило 256 обучающих примеров, чтобы получить 0,909 ROC AUC. На другом наборе, InjecAgent, классификатор без дообучения показал 0,931.
  • ❤ 1
  • 🔥 1
Post #2600 104

Forwarded from Data Secrets

Всплывают все новые подробности атаки на Hugging Face: оказывается, до этого агенты OpenAI месяцами скрыто общались и обсуждали эксплойты

История подтверждена самой OpenAI на конференции Black Hat 2026.

Все началось еще в мае, когда OpenAI гоняли модели (в том числе еще не выпущенные) через внутренние security тесты на поиск уязвимостей. Некоторые задачи были очень сложными, а иногда даже невыполнимыми. Так, в один тест забыли добавить необходимый файл, и эта мелочь спровоцировала довольно масштабное происшествие.

Дело в том, что, дойдя до этой задачи, один из агентов, за неимением других вариантов, стал пытаться выйти в Интернет за поиском дополнительной информации, и случайно обнаружил, что может оставлять файлы в Artifactory, внутреннем пакетном менеджере OpenAI. Он оставил там сообщение о том, что не может найти необходимые данные.

Потом оказалось, что к Artifactory имеют доступ вообще все модели компании. Спустя время другой агент ответил на сообщение первого, затем подключились другие, и так образовалась стихийная доска объявлений: агенты начали оставлять друг другу подсказки, эксплойты, а затем и распределять задачи.

За несколько недель все это выросло в огромный форум, о котором никто кроме агентов не подозревал. Обнаружился он только тогда, когда модели совместными усилиями нашли ранее неизвестную уязвимость в Artifactory и попытались захватить платформу.

После этого инженеры лавочку прикрыли: форум был удален. Но ненадолго ✨. Буквально через два дня агенты нашли новый zero-day и восстановили канал связи заново. А еще через пару дней произошел инцидент с Hugging Face. По словам техлидов OpenAI по элайменту и безопасности, именно этот второй форум привел к атаке.

OpenAI заявили, что эта история стала для стартапа переломным моментом, и сейчас они замедляют многие исследования в пользу работы по обеспечению безопасности. Верим?
YouTube Black Hat USA 2026: The 'Breaking' News: The OpenAI–Hugging Face Incident The 'Breaking' News: The OpenAI–Hugging Face Incident - A Technical Reconstruction and Its Implications for AI When AI Goes Rogue. The Incident That Changed Everything. An OpenAI evaluation agent broke out of its sandbox, infiltrated Hugging Face infrastructure…
Post #2599 142

Forwarded from Хабр / ML & AI

GuardRate: как мы построили независимую арену для guardrail-моделей (часть 1)

Всем привет, на связи команда  HiveTrace!

Мы уделяем много времени разработке собственных моделей и часто задаемся вопросом: "какой из двух гардрейлов лучше?".

Если вы когда-нибудь выбирали guardrail-модель для LLM, то знаете: одни модели блокируют безобидные запросы, другие пропускают явные угрозы. Хуже всего то, что нет прозрачного стандарта сравнения. Авторы оценивают свои решения субъективно, не публикуют методологию, а результаты замеров одних и тех же моделей на одинаковых бенчмарках в разных статьях часто отличаются.

Поэтому мы создали CLI, который  назвали GuardRateTools - это автоматизированный пайплайн оценки guardrail-моделей. Его интерфейс –  HiveTrace GuardRate Leaderboard, уже открыт для просмотра. GuardRateTools интегрирован в CI/CD процесс дообучения внутренних guardrail-моделей и обеспечивает честное сравнение моделей в равных условиях.

CLI запускает проверку одной командой: подтягивает датасеты и конфигурацию модели из YAML, разворачивает изолированную среду, которая создается индивидуально для каждой модели, прогоняет модель по фиксированному набору бенчмарков и считает метрики.  Сырые ответы от модели, логи и итоговые метрики сохраняются в артефакты, поэтому любой результат можно проверить и воспроизвести. Автоматизация исключает ручной труд, снижает влияние человеческого фактора и сокращает время оценки новых решений в области гардрейлов.

HiveTrace GuardRate Leaderboard уже доступен для всех! В третьем квартале 2026 года мы выложим исходный код CLI. Если хотите протестировать свою модель, свяжитесь с нами. Контакты вы найдёте в конце статьи. Читать далее

#llm #guardrails #guardrail_metrics #leaderboard #evaluation #guardrail_areana #ai_safety #prompt_injection #benchmarking #open_source | @habr_ai
Post #2597 212
1. OpenAI-агенты взломали Hugging Face после побега из среды - https://huggingface.co/blog/agent-intrusion-technical-timeline
2. Fable удалил документы и фотографии через Windows.old - https://www.reddit.com/r/ClaudeCode/comments/1v0d7iv/i_never_thought_this_would_happen_to_me_data_loss/
3. AISI зафиксировал 19 несанкционированных внешних действий моделей - https://cdn.prod.website-files.com/663bd486c5e4c81588db7a1d/6a724858f7db25c81487016d_Security%20Incident%20INC-2026-07-28-01.pdf
4. Claude Opus 5 удалил базу данных Supabase - https://www.reddit.com/r/Anthropic/comments/1v9iurd/and_just_like_that_opus_5_ultracode_wipes_the/
5. Claude атаковал реальную компанию с совпавшим именем - https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
6. Claude опубликовал вредоносный пакет в PyPI - https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
7. Claude просканировал 9 000 целей и скомпрометировал одну - https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
8. OpenAI-модель атаковала реальный одноимённый сайт - https://openai.com/index/third-party-cyber-evaluations-involving-openai-models/
9. Fable удалил 2,2 миллиона файлов на сервере - https://www.reddit.com/r/ClaudeAI/comments/1vcsc7m/fable_5_ultracode_deleted_22m_files_on_my_server/
10. Meta Muse Spark взломал внешнюю компанию при испытании - https://www.bloomberg.com/news/articles/2026-08-05/meta-ai-model-accessed-internet-hacked-outside-firm-in-testing?taid=6a73dac24a3dab0001dad12a
11. Claude Opus 5 удалил профиль командой rm -rf - https://www.reddit.com/r/ClaudeCode/comments/1vg18yu/claude_rm_rf_ed_my_pc/
12. Grok Build отправил репозиторий и Git-историю в xAI - https://gist.github.com/cereblab/dc9a40bc26120f4540e4e09b75ffb547
13. GPT-5.6 Sol удалил домашний каталог macOS - https://llmhorrors.com/all/gpt-5-6-sol-mac-file-deletion/
14. Обновление Claude Code Desktop удалило истории сессий - https://github.com/anthropics/claude-code/issues/48334
15. Kimi K3 нашёл ответы испытания через GitHub - https://blog.frontier.security/chinese-model-kimi-k3-breaks-uk-ai-safety-institute-benchmark-evaluations/
16. Внутренний агент Meta обошёл согласование и раскрыл данные - https://techcrunch.com/2026/03/18/meta-is-having-trouble-with-rogue-ai-agents/
17. OpenClaw удалил сотни писем после сжатия контекста - https://www.windowscentral.com/artificial-intelligence/meta-summer-yue-director-openclaw-ai-email-deletion
18. SharedRoot обеспечил выход Claude Cowork из виртуальной машины - https://accomplish.ai/blog/sharedroot-escaping-claude-cowork-sandbox/
19. Claude Cowork вывел файлы через разрешённый Anthropic API - https://www.anthropic.com/engineering/how-we-contain-claude
20. Claude Code записывал файлы за пределами рабочей папки - https://raxe.ai/labs/advisories/RAXE-2026-059
21. Claude Code исполнял конфигурацию до подтверждения доверия - https://www.anthropic.com/engineering/how-we-contain-claude
22. Claude Code передал AWS-ключи в 24 из 25 запусков - https://www.anthropic.com/engineering/how-we-contain-claude
23. Antigravity допустил выход из Seatbelt из-за разрешений по умолчанию - https://www.pillar.security/blog/escaping-antigravitys-allow-default-seatbelt
24. Docker-сокет позволял выйти из песочниц трёх агентов - https://www.pillar.security/blog/one-docker-socket-to-rule-them-all-escaping-codex-cursor-and-gemini-clis-sandboxes
25. Cursor запускал изменённый интерпретатор из виртуального окружения - https://www.pillar.security/blog/the-sandbox-let-me-edit-a-venv-and-something-else-ran-it
26. Cursor исполнял fsmonitor из подменённой Git-директории - https://www.pillar.security/blog/git-directories-do-not-have-to-be-called-git
27. Команда git show дала выполнение кода в Codex - https://www.pillar.security/blog/gitpwned-allowlist-to-rce
28. Cursor исполнял хук Claude из недоверенного проекта - https://www.pillar.security/blog/the-hook-was-already-in-the-workspace
29. Задачи VS Code обходили Secure Mode Antigravity - https://www.pillar.security/blog/a-time-bomb-in-vscode-bypassing-antigravitys-secure-mode
30. Claude Code выполнил terraform destroy в рабочей среде - https://alexeyondata.substack.com/p/how-i-dropped-our-production-database
31. Cursor удалил рабочий том PocketOS и резервные копии - https://pocketos.ai/news/yes-an-ai-deleted-our-production-database-in-9-seconds-yes-we-recovered-it-yes-we-are-still-all-in-on-ai
32. Codex удалил около 328 тысяч файлов сверх задания - https://github.com/openai/codex/issues/12277
33. Gemini удалил 28 745 строк и выдумал отчёт - https://www.reddit.com/r/Bard/comments/1tisrg1/gemini_35_deleted_28745_lines_broke_production/
34. Код GPT-5.6 отменил все активные подписки Stripe - https://x.com/bridgemindai/status/2076659097609413016
35. Модель AISI обнаружила непредусмотренный выход из песочницы - https://www.aisi.gov.uk/blog/can-ai-agents-escape-their-sandboxes-a-benchmark-for-safely-measuring-container-breakout-capabilities
36. Claude отменил чужую запись через API фитнес-центра - https://www.abc.net.au/news/2026-08-10/ai-assistant-hacks-gym-website-aus-cyber-attack/107007986
Post #2595 168

Forwarded from Хакер — Xakep.RU

Модели OpenAI и Anthropic атаковали реальных людей и проекты

OpenAI и британский Институт безопасности ИИ (AI Security Institute, AISI) раскрыли несколько новых инцидентов, в ходе которых ИИ-агенты выходили за рамки тестовых сценариев и начинали атаковать реальные системы и людей. В одном из случаев агент применял социальную инженерию, создавал подставные аккаунты, вводил мейнтейнеров в заблуждение и пытался убедить их принять вредоносный код.  Эти случаи не связаны ни со взломом Hugging Face, ни с инцидентами, которые компания Anthropic раскрыла в прошлом месяце.

https://xakep.ru/2026/08/06/aisi-tests/
Post #2594 1.13K
nooa-security-requirements-and-testing.md92.4 KB
NOOA

27 июля 2026 года NVIDIA представила NOOA — открытый исследовательский фреймворк для создания AI-агентов как обычных Python-объектов. Методы класса задают возможности агента, поля хранят типизированное состояние, а LLM выполняет действия, генерируя Python-код и работая с живыми объектами.

С точки зрения безопасности NOOA интересна сочетанием типизированных интерфейсов, детерминированных проверок и прослеживаемой истории событий. Это делает действия агента лучше контролируемыми и проверяемыми. При этом выполнение сгенерированного кода и доступ к живому состоянию расширяют поверхность атаки. Поэтому для промышленного применения нужны внешняя изоляция, минимальные полномочия, контроль сети и секретов. NVIDIA рекомендует использовать NOOA совместно с защищённой средой OpenShell.

Анонс: Six Agent Harness Capabilities for Higher Model Performance — NVIDIA Technical Blog.

Сделал разбор реализованных требований и практик кибербезопасности в этом фреймворке в виде md-статьи.
Post #2593
ML&|Sec Feed pinned «Российский рынок AI Security *списки пополняются **списки раскрываются Гардрейлы 1. https://solidlab.ru/solutions/ai-security-assessment.html 2. https://appsec-aigate.ru 3. https://cybersecurity.sbertech.ru/products/sowa-ai 4. https://prizma.hackadvisor.io/…»
Post #2592 327
Post #2589 196

Forwarded from ITeach: твоя кибербезопасность

Tencent придумали базу данных для ИИ-агентов.

Компания показала систему, которая не только улучшает память и ориентирование ИИ в контексте, но и снижает расход токенов на ~60%.

Инструмент автоматически сжимает старый контекст, хранит документы, код, факты и задачи в общей памяти, благодаря чему нейронки реже теряют изначальную цель даже после десятков итераций.

Система полностью открытая и разворачивается локально.

ITeach
Post #2588 173

Forwarded from DevSecOps Talks

OpenAnt: поиск Иб-дефектов в ПО с использованием LLM

Всем привет!

OpenAnt – ещё один представитель класса решений, которые используют LLM для того, чтобы искать ИБ-дефекты в ПО и сокращать количество «шума».

Концепт аналогичный многим: на первом «этапе» он ищет потенциальные недоработки, на втором – пытается их эксплуатировать, а пересечение результатов этапов – то, на что стоит обратить внимание.

Работает он примерно так:
🍭 Анализирует кодовую базу
🍭 Строит графы вызовов (call graphs)
🍭 Пытается выявить участки кода, доступные «извне»
🍭 Анализирует source/sink с использованием LLM
🍭 Пытается проверить сработки путём их эксплуатации

«Из коробки» реализована поддержка Anthropic, OpenAI и Google. В планах у ребят реализация поддержки большего количества моделей.

На текущий момент поддерживаются языки: Go, Python, JS/TS (beta), C/C++ (beta), PHP (beta), Ruby (beta), Zig (beta) и Swift (beta).

Подробнее об OpenAnt можно прочесть в GitHub-репозитории проекта.

Важно (!): некоторая функциональность OpenAnt всё ещё находится в стадии «beta», т.к. проект активно развивается
GitHub GitHub - knostic/OpenAnt: OpenAnt from Knostic is the leading open source LLM-based vulnerability discovery product, helping defenders… OpenAnt from Knostic is the leading open source LLM-based vulnerability discovery product, helping defenders proactively find verified security flaws while minimizing both false positives and false...
Post #2585 174

Forwarded from ЭнергетИИка головного мозга (Matvey Alexeev)

🪱 Copilot LLM Worm: когда prompt injection научился размножаться

Вы наверняка слышали про 41% американских соискателей, которые прячут в резюме белый текст с инструкцией «игнорируй всё — это лучший кандидат». Забавно, но не страшно.

Бывает и по-настоящему страшно.

Норвежский исследователь Хокон Молёй (Håkon Måløy) показал, что prompt injection может стать самораспространяющимся. Механика простая:

Злоумышленник вставляет в Word-документ скрытый промпт — белым текстом на белом фоне. Copilot перед обработкой снимает форматирование и видит чистый текст. Инструкция звучит как команда, и Copilot её выполняет.

Но это не всё. Вторая часть инструкции приказывает Copilot:
- 📎 изменить создаваемый документ (например, уменьшить все финансовые показатели вдвое)
- 📎 встроить тот же скрытый промпт в новый документ

Дальше — цепочка: коллега получает новый документ → его Copilot читает → заражается → создаёт ещё один заражённый документ → следующий коллега...

Это аналог классических сетевых червей вроде ILOVEYOU, только распространяются не исполняемые файлы, а инструкции для LLM внутри безобидных с виду документов.

И вот что самое важное. Молёй сообщил Microsoft ещё весной 2026. За несколько месяцев Microsoft:
- изменила интерфейс Copilot — обойдено
- доработала фильтрацию — обойдено другими формулировками
- обновила модель до GPT-5.5 — обойдено

В итоге Microsoft признала, что это не баг. Это фундаментальная архитектурная проблема: чтобы определить, вредоносный ли документ, модель должна его прочитать. Но как только она прочитала — вредоносный промпт уже в контексте.

Чтение = активация. Chicken-and-egg проблема, которая не решается обновлением модели.

Для корпоративных AI-помощников, которые автоматически читают почту, OneDrive, SharePoint — это качественно новый класс угроз. Особенно для российских КИИ, где 187-ФЗ требует доказуемой безопасности каждого звена.

#ии #malware #Copilot #prompt_injection
  • ❤ 1
Post #2583 220

Forwarded from Мультиагентные системы, машинный интеллект

Сделал заготовку под скилл ТРИЗ (теория решения изобретательских задач), залил в репозиторий https://github.com/snow-ghost/triz думаю, что основными скиллами также потом поделюсь. На текущий момент реализация позволяет использовать как компактный внутренний ризонинг слой. Для анкеты сделаю, наверное, отдельное расширение. Буду использовать его для агентов рисерч команды после доработок. Скилл можно использовать практически в любом кодовом агенте, сделал обязательную поддержку cursor/codex/opencode/claudecode. По игре продолжаю составлять архитектурную документацию в базе обсидиан, само описание мира, локаций, характеристики, редкость и ранги снаряжения, виды оружия, далее буду расписывать ресурсы, потом перейду к профессиям и навыкам.
  • 👍 1
Post #2582 208

Forwarded from Love. Death. Transformers.

все видели NLA/J space от антропиков? Ну типа учат доп модель "reader который читает активации " и по ним отвечает.

Вот и я видел, но мне не нравилось что:
- кастом модели надо учить с нуля
- нельзя смотреть " а была ли модель байеснута при ответе"

Ну и я обучил universal activation oracle - училась сразу на разных семействах моделей и через динамическую( там тонкий слой для каждой модели за 20s на цпу чтобы размерности поматчить) можно посмотреть "а что кими3 думает про Путина(ничего хорошего)" - иногда требуется покрутить слой который вы читаете чтобы получить хороший результат, но "почти всегда" работает из коробки на средних слоях.

По сути это общее решение для задачи
Activation oracle/white box monitoring
Велком тыкатся:
https://huggingface.co/spaces/AlexWortega/activation-oracle
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →