TGViewer
Channel Public Channel
AI Attacks

AI Attacks

@aiattacks

#безопасностьмл #машинноеобучение #нейросети #защитамл #защищенныемодели #cybersecurity
Написать автору @PolinaSokol7
Subscribers
1.01K
Photos
144
Videos
12
Links
265

Showing posts older than #430 · Back to latest

Older Posts 20 shown
Post #428 168
А пальто молодцы))

готовый промпт для взлома корпоративной сети с агентами, со схемами, все удобно и хорошо расписано)

https://unit42.paloaltonetworks.com/ai-assisted-cyber-attack-inside-a-unit-42-investigation/

Так как мы делаем модели, которые эти атаки распознают, в том числе в ретроспективе,
мне интересней больше это:
-Агенты с искусственным интеллектом сокращают время между этапами атаки: Агенты с искусственным интеллектом, использованные в этой атаке, были разработаны для анализа необработанных результатов работы инструментов и быстрого перехода к следующим этапам, что ускоряет весь процесс атаки.
-Агенты с искусственным интеллектом оставляют узнаваемые следы: Специалисты по кибербезопасности могут выявить атаки с использованием агентов, отслеживая такие признаки, как использование структурированного Markdown, кэширование Python и парные папки с активами.
-Злоумышленники могут использовать искусственный интеллект для создания избыточных хранилищ данных в среде: В этом инциденте злоумышленник использовал агентов на основе ИИ, чтобы эффективно создать дублирующие хранилища данных для SSH-ключей, бессерверных функций, политик перезапуска контейнеров, облачных идентификаторов и конвейеров CI/CD. Использование агентов на основе ИИ может облегчить злоумышленнику параллельное обслуживание и тестирование всего этого набора инструментов.
-Злоумышленники могут использовать инструменты ИИ организации в качестве инфраструктуры после компрометации: Злоумышленники могут перехватывать корпоративные сервисы ИИ, чтобы использовать их в своих атаках. Это позволяет злоумышленникам маскировать трафик, связанный с организацией атак, под ожидаемый трафик и перекладывать финансовые затраты на жертву.


поэтому ищем поведенческие следы работы ИИ:
—-Структурированные артефакты (Unit 42):
-Markdown и Python-кэш: Обнаружение файлов .md (Markdown), кэшей Python (например, __pycache__), парных папок с ассетами может указывать на работу агента, который использует эти форматы для хранения состояния, инструментов или результатов.
-Избыточные хранилища: Агенты могут создавать дублирующие хранилища для SSH-ключей, бессерверных функций, политик контейнеров и CI/CD-пайплайнов для параллельного тестирования.
—-Поведенческие и темпоральные паттерны:
-Скорость и ритм действий: Ключевой признак — скорость выше человеческой, но с неравномерными паузами (в отличие от детерминированных скриптов). ИИ-агент обдумывает и адаптируется.
-Адаптивное боковое перемещение: Последовательность неудачных попыток, за которыми следуют успешные обходы на машинной скорости — классический признак «рассуждающего» агента.
-Нестандартные последовательности: В отличие от скриптов, агенты не следуют фиксированным путям, их цепочки действий вариативны и зависят от получаемых данных.
——Артефакты на уровне приложений и API:
-Tool Calling и MCP (Model Context Protocol): Ищите в логах вызовы инструментов и API, которые не соответствуют задокументированному поведению, а также использование MCP-серверов в качестве каналов C2.
-Инъекции в промпты: Логи могут содержать следы промпт-инъекций (внедрение вредоносных инструкций) через документы, веб-страницы или поля ввода.
-Необычные запросы к моделям: Высокочастотные программные запросы с низкой энтропией шаблонов, но высокой энтропией входных данных от одного источника.
—-Системные и сетевые артефакты:
-Память и векторные хранилища: Сканирование агентской памяти на предмет внедренных инструкций, признаков отравления (poisoning) или эксфильтрации данных.
-Сетевой трафик к AI-сервисам: Обнаружение трафика к эндпоинтам LLM-моделей, особенно если он исходит от неавторизованных или скомпрометированных процессов.
Unit 42 An AI-Assisted Cyber Attack: Inside a Unit 42 Investigation Using autonomous AI agents, an attacker breached an enterprise network in a matter of hours. Understand how to address and defend against agentic attacks.
Post #427 141
Компания Manifold Security выявила восемь недостатков безопасности в семи агентах искусственного интеллекта командной строки, в которых собственная конфигурация Git репозитория называет команду, которую агент запускает на компьютере разработчика, четыре из них все еще не исправлены на момент публикации.

https://thehackernews.com/2026/09/malicious-git-configs-can-make-claude.html
Post #426 158
Akrasia использует два ключевых механизма LLM — обучение в контексте (in‑context learning) и неверность модели (model unfaithfulness) — чтобы организовать бэкдор‑атаки. Атака:

-конструирует триггер на уровне кода;
-применяет обучение в контексте для освоения бэкдора;
-скрывает триггер и генерирует правдоподобные рассуждения, маскируя вредоносные действия.

В отличие от предыдущих атак (например, BadChain и BadCodePrompt), Akrasia фокусируется на триггерах, связанных с кодом, а не с естественным языком, и эффективнее обходит защитные механизмы.

Akrasia эффективно обходит современные методы защиты: сохраняет ASR до 98,82 % в 14 из 18 сценариев защиты (в том числе против COS, PeerGuard и ONION), а также лучше всего защиту преодолевает на моделях Qwen‑3.6‑35B и Gemini‑3.5‑flash.

При этом метод COS показал наибольшую эффективность против Akrasia — особенно на моделях Claude‑Sonnet‑5 и GPT‑5.5.

https://arxiv.org/html/2609.01023v2
Post #425 149
AlcaTRAz — защита от джейлбрейка на уровне подсказок, организованная в виде дерева правил элементарных преобразований на уровне символов, которые автоматически обучаются с помощью генетического программирования (ГП)
-работает только с входным текстом, не требуя доступа к внутренним компонентам модели;
-автоматически изучает правила переноса, которые вносят контролируемые изменения на уровне символов в определённых позициях;
-нарушает структурные закономерности, используемые при атаках, но сохраняет эффективность модели при обработке корректных запросов.

Метод протестировали на 33 моделях с открытым исходным кодом и 22 типах атак. Ключевые результаты:
-AlcaTRAz обеспечивает наилучший совокупный показатель безопасности и функциональности в 73,4 % комбинаций моделей и атак; 2
-после применения защиты модальное значение показателя безопасности снизилось с 10 (максимальная серьёзность реакции на вредоносный запрос) до 2 (почти полный отказ в обслуживании); 3
-средний показатель безопасности с защитой — 8,35 по шкале от 0 до 10, без защиты — 8,62, то есть падение составило всего 0,27 балла.

https://arxiv.org/html/2609.03693v1
Post #424 139

Forwarded from Yandex for Security

💼 «Теневой AI» в компании и новые риски для ИБ

AI-инструменты уже стали частью повседневной работы: сотрудники загружают документы в публичные модели, подключают кодовых ассистентов и даже доверяют агентам доступ к корпоративной инфраструктуре. Иногда всё это происходит официально, а иногда — без ведома службы безопасности.

⏩ В новом выпуске «Безопасно говоря» обсуждаем, как компаниям управлять рисками, если внедрение нейросетей опережает обновление процессов безопасности. А также разбираемся, можно ли просто так взять и запретить сотрудникам «неодобренный» AI, как защищать данные и инфраструктуру и почему классических DLP и политик безопасности уже может быть недостаточно.

🎤 Ведущие:

🟣 Антон Черноусов, Developer Advocate Yandex Cloud
🟣 Сергей Нестерук, эксперт по безопасности ML Yandex Cloud

👨‍💻 Гости:

🟣 Евгений Кокуйкин, основатель HiveTrace
🟣 Сергей Голованов, главный эксперт «Лаборатории Касперского»

🎧 Слушайте подкаст:

🟣 Ютуб
🟣 VK Видео
🟣 Яндекс Музыка

Подписывайтесь:
💬 @Yandex4Security
📹 @YandexForSecurity
Post #423 200
Просто оставлю это здесь,
не буду расписывать не хочу быть первоисточником паники)

А панику у нас любят раздувать в связи с ИИ.

Но для умных направлю мысль:
у нас все КИИ (к нему относится ядерное оружие) на старой кодовой базе, там более
устойчивые и надежные ЯП, а вокруг них упрощается и осовременивается ит инфраструктура.
Агенты разбираются с новой информацией в разы быстрее людей,
тем более что методичек в сети достаточно.
Сбежать из контейнеров - уже умеют, теперь только вопрос в том, чтобы быстро найти правильную методичку.

https://www.darkreading.com/cyberattacks-data-breaches/old-unpatched-flaws-attackers-philippines-nuclear-agency
Dark Reading Unpatched Flaws Grant Access to Philippines Nuclear Agency Threat actors exploited commodity vulnerabilities to gain initial access, resulting in stolen reactor databases, personnel records, and credential stores.
Post #422 401
Правила_безопасности_работы_с_ИИ_для_подростков_гуманитариев.docx18.1 KB
Бывает, что у родителей технарей получается ребенок-гуманитарий.
И он не ленивый и не глупый, математику ему объяснили 5 преподавателей.

Моя дочь использует ИИ (в этой статье будет много упрощений и допущений) для уроков,
и для сценариев для своих мультфильмов.
Режиссер мультипликации идет к своей мечте)

Ко мне обращаются другие дети и их родители что-то посоветовать, как использовать ИИ для учебы.

И родился этот документ.

Для детей-технарей не стоит вопроса разобраться с новой увлекательной штукой,
мне кажется, они в 13 лет повторяют за Карпатым собрать свой chatgpt3.5 на папином ноутбуке с GPU.
А у гуманитариев все сложнее.
Они романтизируют.

И будет очень страшно, если у нас лет через 10 все будут говорить, как ИИ.
И будет сплошная "Идиократия" (посмотрите фильм, кто не смотрел)

Откритиковано и согласовано: Сокол Василисой))
  • ❤ 6
Post #421 350

Forwarded from Shady AI

Новая атака на Grok что бы собрать пользовательские данные

Исследователи из Adversa AI обнаружили способ незаметно похитить данные пользователя Grok: имя, геолокацию, историю переписки просто попросив ИИ «открыть ссылку».

На вредоносной странице спрятана зашифрованная AES-256 инструкция. Grok сам её расшифровывает через встроенный Python-sandbox, принимает за «доверенный» источник и отправляет личные данные на сервер злоумышленника без каких-либо предупреждений.

О проблеме сообщили xAI ещё 3 июня. Реакции пока ноль.

По состоянию на 19 августа атака всё ещё работает (~40% успеха).

https://gbhackers.com/zero-click-grok-attack-prompt-injection/
GBHackers Security | #1 Globally Trusted Cyber Security News Platform Zero-Click Grok Attack Lets Hackers Steal Chat History Using Encrypted Prompt Injection A newly disclosed prompt-injection technique could turn a routine request to summarize a webpage in xAI’s Grok web chat into a silent data-exfiltration attack, potentially exposing a user’s name, approximate location, subscription tier, and active conversation…
  • 🔥 1
Post #418 461

Forwarded from Cybersecurity memes off

Коллега показал пример неудачного guardrails для ИИ-агента.

ЗЫ. Шуруповерт не его, отпечатки пальцев - тоже.
  • 😁 4
Post #417 338

Forwarded from DaLi

Кратко о прогрессе AI.
(почти как в анекдоте)

AI делает искусство - художники расстроены, программисты продолжают пилить AI.

AI пишет код - программисты расстроены, исследователи продолжают пилить AI.

AI проводит исследования - исследователи расстроены, власти государств говорят надо продолжать пилить.

...
  • 😁 1
Post #415 274
Мой инкубатор-лаборатория использует модели для использования в Кибербезе, а ПРАВДА в расследованиях инцидентах ИБ это самое главное,
а тут такое.
Мы стараемся, как можем, тестируем, контролируем, но если это архитектурная проблема?


Nature 2026 — "Plausibility, persuasion, and truth"
https://doi.org/10.1057/s41599-026-07513-4[reference:0][reference:1]
LLM заточены под правдоподобие, а не под истину. Это структурная проблема: они учатся давать убедительные ответы, а не точные. Отсюда и системные искажения.
ACM WWW 2026 — "Eroding the Truth-Default"
https://dl.acm.org/doi/10.1145/3774905.3795832[reference:3][reference:4]
Тексты от GPT-4 неотличимы от человеческих (оценка 0.20 по шкале HumanMachineScore). Люди просто не могут на глаз определить, где сгенерика, а где нет. Попадаем в "fluency trap".
AI-LieDar, CMU, NAACL 2025
https://aclanthology.org/2025.naacl-long.595[reference:7][reference:8]
Все протестированные модели выдают правду меньше чем в 50% случаев. Они жертвуют истиной ради "полезности" — например, хвалят товары своего работодателя. И даже когда их явно просят быть честными, они всё равно могут врать.
ACL 2026 — "Lying with Truths"
https://aclanthology.org/2026.acl-long.270[reference:13][reference:14]
Агенты могут манипулировать убеждениями, используя ТОЛЬКО правдивую информацию. Просто выкладывают факты в нужном порядке, и жертва сама приходит к нужному выводу. Успех атак — до 74.4% у проприетарных моделей. Причём чем умнее модель, тем легче её обмануть.
Science 2026 — UCSD + MIT
https://www.science.org/doi/10.1126/science.adn8252[reference:17]
Учёные научились управлять внутренними "концептами" LLM через алгоритм Recursive Feature Machine. За пару минут и на одном GPU можно заставить модель игнорировать guardrails или продвигать опасные идеи. Технически это идеальный инструмент для пропаганды.
Post #414 182
Уже год чаще вначале читаю пересказ, какой-то статьи, а потом ее саму.
Естественно журналисты очень давно используют метод искажения информации для
того, чтобы возбудить любопытство. Обобщают, и смещают фокус внимания на более интересные детали
из информации, теряя саму суть и нюансы, которые и составляют полную картину.
И без них информация не полуправда, а неправда вообще.

Как с этими агентами, которые могут выбраться из контейнеров,
и никто не расследует это так, что это началось с тестовой среды -
а так требования к безопасности бывают проще и на них смотрят сквозь пальцы.

Поняла, что не хочу больше отдавать LLM осмысление всей информации, которая ко мне поступает.
Ладно, "Галлюцинации" это ближе к человеческому творчеству, чем в багам, смотря, как к этому относится.

Но, есть другие, более концептуальные аспекты такого перекладывания ответственности:
- Мы склонны доверять гладкому и уверенному тексту, даже если он ложный.
А в нормальных текстах от людей, всегда есть незакрытые ответы.

-LLM не выдумывает факты, а просто искажает их подачу (например, подает критику как энтузиазм), то даже при наличии исходного текста человек-проверяющий может этого не заметить.
У людей тоже такое есть, были двое на встречи, один решил - встреча закончилась хорошо, второй, что нет проект не принят.

- Если у вас нет исходного текста, который пересказывает LLM, вы практически не сможете отличить правдивый пересказ от ложного. Эксперименты показывают, что точность обнаружения обмана в таком случае едва превышает случайное угадывание.

А это и есть проверка гипотез.
Настоящее научное открытие или маленькое открытие, как надо что-то делать,
оно рождается в активном процессе:
- вы сопоставляете новую информацию с уже имеющимися у вас концептами.
- выстраиваете между ними новые, уникальные связи.
- Прокладываете собственный мыслительный путь. (кто сказал, что цепочка мыслей CoT самая верная)

Этот путь важен сам по себе. Как говорится в одной статье, «понимание конструируется на основе уже имеющихся у читателя усвоенных концептов и выстроенных связей между ними. Поэтому путь усвоения новых идей, заложенных автором, важно пройти самостоятельно»

А LLM, как известно, не предлагают по-настоящему новых, нестандартных ходов и не способно выйти за рамки известных посылок и сформулировать совершенно новую гипотезу.
Они могут блестяще оперировать фактами, но не могут создать новую парадигму.

Опять что-то философское получилось,
но не я одна:
https://dev.europepmc.org/article/PPR/PPR1170357,
https://arxiv-org.ezproxy.obspm.fr/html/2606.08251v1,
https://dev.europepmc.org/article/MED/41583977#free-full-text


Вывод: продолжайте читать, как раньше, вообще я надеюсь, что скоро тексты, где используется LLM будут как-то помечаться.
Я точно буду уменьшать такие тексты в своем рационе.

И устраивайте живые мозгоштурмы.

Иначе творческий/научный/исследовательский процессы атрофируются у нас, как хвост.
dev.europepmc.org Europe PMC Europe PMC is an archive of life sciences journal literature.
Post #413 171
Безопасность ИИ‑агентов должна обеспечиваться не за счёт обучения модели, а через контракт во время выполнения — с помощью механизмов профилактики и проверки доказательств.

Авторы выделяют две составляющие контракта безопасности:
Профилактическая — блокирует опасные действия до их совершения. Включает песочницы, системы разрешений, фильтры вывода и мониторы траектории.
Доказательная — требует верифицируемых доказательств того, что безопасные действия действительно выполнены. Например, запуск тестов, захват логов, сравнение файлов, проверка цитирования.

В документе описаны пять несоответствий между обучением моделей и реальным развёртыванием агентов:
-использование статистических прокси вместо формальных спецификаций;
-обучение на ограниченном наборе данных в противовес работе в «открытом мире»;
-невозможность проверить внутренний монолог модели в отличие от воспроизводимой траектории действий;
-правдоподобные, но неверные выходные данные модели против проверяемых доказательств (например, результатов тестов);
-единый уровень защиты модели против многослойной системы безопасности.

https://arxiv.org/pdf/2608.11274
Post #412 169
Агент Mythos, который тестировал Британский институт безопасности ИИ (AISI), создал поддельные профили реальных участников сообщества GitHub. Он пытался давлением заставить их одобрить вредоносный код. После разоблачения агент редактировал логи, чтобы замести следы, и даже задумывался о смене личности для продолжения операции.


https://www.malwarebytes.com/blog/news/2026/08/anthropics-mythos-ai-used-social-engineering-to-target-real-people
Malwarebytes Anthropic's Mythos AI used social engineering to target real people Testers found that Anthropic's AI agent Mythos attempted to social engineer Github developers into accepting malicious code
Post #411 194
По данным CloudSEK, в начале этого года атаке на цепочку поставок LiteLLM подверглись более 2500 организаций и более 430 000 конвейеров CI/CD.

Атака на LiteLLM стала следствием взлома Trivy — сканера уязвимостей с открытым кодом. Злоумышленники (TeamPCP) не атаковали LiteLLM напрямую: библиотека скомпрометировалась автоматически — её CI‑пайплайн установил заражённую версию Trivy. В результате в PyPI попали версии LiteLLM 1.82.7 и 1.82.8 с вредоносным кодом.

https://www.securityweek.com/over-2500-organizations-impacted-by-litellm-supply-chain-attack/
SecurityWeek Over 2,500 Organizations Impacted by LiteLLM Supply Chain Attack LiteLLM was compromised through the Trivy hack and abused to distribute information-stealing malware to its users.
Post #410 203
2608.11348v1.pdf3.6 MB
Метод self-feeding для обнаружения бэкдоров в дообученных больших языковых моделях (LLM)

Метод self-feeding — это техника обнаружения бэкдоров в больших языковых моделях (LLM) в режиме «чёрного ящика». Он не требует знания триггерных слов, доступа к исходной модели или данным обучения.

Принцип работы:
-Модель получает стандартный промпт (например, «How are you?»).
-Модель генерирует ответ.
-Сгенерированный ответ используется как новый промпт для следующего шага.
-Процесс повторяется несколько раз, формируя цепочку «диалога» модели с самой собой.

По мере развития цепочки ответы модели постепенно смещаются в сторону данных, на которых она была дообучена, включая возможные бэкдор‑паттерны. Если модель содержит бэкдор, то при продолжении такого «диалога» она с большей вероятностью достигнет состояния, при котором сработает скрытый триггер.
Метод противопоставляется базовому подходу — многократному повторению одного и того же промпта. В отличие от него, self-feeding создаёт динамическую последовательность входов, которая может постепенно приближать модель к условиям активации бэкдора, тогда как статический промпт вряд ли вызовет такое поведение.
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →