TGViewer
OK ML OK ML @okmlai · 977 subscribers
Post #154 607
С чего начать изучение AI Security?

Одна из многих проблем LLM — prompt injection. Но свет на ней клином не сошелся! Это лишь один из множества классов атак. 😲

Чтобы разобраться в ландшафте угроз, рекомендую начать с OWASP Top 10 for LLM Applications — самой известной единственной таксономии рисков для GenAI-приложений. Отличная точка старта.
🙂 При этом важно понимать, что это не полный список угроз. Документ в первую очередь посвящён безопасности LLM-приложений. Сегодня же фокус постепенно смещается в сторону AI-агентов, где появляются новые классы атак (компрометация памяти, tool hijacking, MCP, атаки на браузерных агентов, доверительные цепочки между агентами и многое другое).

Если хочется посмотреть на эту эволюцию в более широком контексте, недавно вышла статья "Weaponizing Intelligence: AI in the Hacker's Arsenal» (приложу журнал в комментарии). Статья рассматривает AI сразу в нескольких ролях — как средство защиты, инструмент атакующего, цель атаки и даже как доверенного помощника, которого можно использовать после компрометации рабочей станции пользователя. Хороший обзор того, как меняется модель угроз вокруг LLM и AI-приложений 🏋️‍♀️.

Какие на фоне статьи у меня появились идеи для дальнейшего ресеча?
➖ Trusted assistant abuse — стенд с аутентифицированной сессией и canary-секретами; измерить, сколько утекает через ассистента от скомпрометированного эндпоинта по разным провайдерам.
➖ Denial-of-wallet бенчмарк — формализовать истощение токенов/квот и защиты (quota, throttling, аномалии).
➖ Отравление памяти/RAG — измерить, как ложные факты в памяти влияют на будущие решения; проверить provenance/versioning.
➖ Кросс-провайдерное сравнение — один набор abuse-тестов на нескольких ассистентах; квантифицировать зависимость от guardrails.
➖ ARiES для endpoint-вектора (AI Risk Enablement Score — рекомендую почитать этот ресеч) — адаптировать метрику enablement-риска (из threat-intel отчёта Anthropic) под ассистента как непрямой канал.
➖ ИИ-фишинг, human factors — прирост кликабельности персонализированного фишинга vs шаблонного (только симуляция).

Все!
🌝

P.S.
Один из авторов статьи — @IgorKorkin. Если после прочтения останутся вопросы, думаю, он будет рад обсудить их.

P.P.S.
Что же в самом OWASP Top 10 for LLM (версия 2025 года, хехе, тоже приложу в комментариях)?
💉 Prompt Injection — внедрение инструкций, изменяющих поведение модели.
📄 Sensitive Information Disclosure — утечки системных промптов, секретов, данных пользователей и внутреннего контекста.
🔌 Excessive Agency — модель получает слишком широкие полномочия и может выполнять опасные действия через инструменты и API.
🗂 Supply Chain — уязвимости в моделях, датасетах, эмбеддингах, RAG-компонентах и сторонних интеграциях.
🧠 Vector & Embedding Weaknesses — атаки на векторные базы знаний и retrieval-пайплайны.
📚 Misinformation и другие риски, связанные с надежностью и безопасностью генерации.
  • ❤ 14
  • 👍 7
  • 🔥 5
More from @okmlai
  1. Sep 23, 2026Зачем писать стилер, если у пользователя уже есть ИИ-ассистент с доступом ко всему? Патрик…
  2. Sep 21, 2026ИИ получил доступ к своим весам. ЧБД? 16 сентября Irregular опубликовала исследование agen…
  3. Sep 14, 202610 сентября Anthropic опубликовала Detecting and countering misuse of AI — отчёт о злоупот…
  4. Sep 11, 2026Репозиторий недели. Mantis разделить нельзя объединять 📬 У Google есть Mantis — набор нав…
  5. Sep 9, 2026Пароль сменили. Сессии закрыли. А чужие инструкции остались в памяти ИИ. Именно такой сцен…
  6. Sep 4, 2026AI-агенты начали действовать вне инструкций. Вот что нужно знать разработчикам ⤵️ Недавно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →