TGViewer
Безопасно говоря Безопасно говоря @yndxcloudsecurity · 1.08K subscribers
Post #99 983
Как обезопасить ИИ-агентов от взлома

ИИ всё активнее используют для защиты: он фильтрует спам, ловит фишинг, ищет аномалии. Но все агенты опираются на данные от пользователей, среди которых могут быть и злоумышленники.

5 основных способов, как могут действовать злоумышленники👇


1️⃣ Data poisoning — вредоносные данные подмешивают в обучающую выборку. Даже небольшая доля искажённой информации может существенно повлиять на результат, особенно в сценариях дообучения на проде.

2️⃣ Model poisoning — атаки на архитектуру или параметры модели. К примеру, внедрение бэкдора, который активируется только при определенном триггере.

3️⃣ Adversarial input. Модифицированные входные данные, которые визуально неотличимы от оригинала, но сбивают модель с толку. Классический пример — измененный дорожный знак, который распознается как другой.

4️⃣ Model stealing и data extraction. С помощью запросов и анализа откликов злоумышленник может восстановить параметры модели или извлечь данные, на которых она обучалась.

5️⃣ Черный ящик. Объяснить, почему ИИ сработал так, как сработал, бывает непросто. А в ИБ это критично: нужно понимать, что произошло и почему.


👉 Руководство по снижению рисков при разработке и внедрении ИИ‑агентов на базе LLM

Мы активно используем агентную систему в собственных сервисах, и поэтому непрерывно работаем над методологией защиты.

Делимся с ИБ‑сообществом нашими наработками.

В документе мы описали угрозы и методы защиты для ключевых компонентов ИИ‑агентов: самих генеративных моделей, а также модулей и баз знаний, которые используются при работе разрабатываемых ИИ‑продуктов.

Особое внимание уделили безопасности данных и предотвращению рисков, возникающих из‑за автономности агентов.

В том числе — практический чек-лист безопасности по уровням AI-SAFE. В нем описываем конкретные шаги для защиты ИИ-агентов, структурированные в соответствии с пятиуровневой моделью AI SAFE.

Забрать документ →
  • 🔥 8
  • 🤝 3
  • ❤ 2
  • 👏 1
More from @yndxcloudsecurity
  1. Sep 24, 2026Post #328
  2. Sep 24, 2026⭐️ У нашего направления в Yandex B2B Tech появилось своё имя — Yandex Security. Yandex Sec…
  3. Sep 23, 2026⤴️Вы — только облако⤵️ Спасибо всем, кто проголосовал! Такой результат получился большинст…
  4. Sep 23, 2026Post #325
  5. Sep 22, 2026Post #324
  6. Sep 22, 2026Post #323
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →