TGViewer
Makrushin Makrushin @makrushin · 3.87K subscribers
Post #489 1.9K
Запросы к LLM — новые индикаторы компрометации

Разработчики ИИ-моделей все чаще публикуют отчеты, в которых рассказывают о сценариях использования злодеями их продуктов для «вайб-хакинга»: автоматизации разведки и анализа поверхности атаки, разработки вредоносного софта, подготовки фишинговых сообщений и даже для организации шпионажа. При этом нельзя назвать эти публикации полноценными Threat Intelligence отчетами, потому что в них нет наиболее важной части: индикаторов компрометации — информации, которая позволит владельцу ИИ-модели и специалисту по защите выявлять описанные сценарии у себя в инфраструктуре.

В подобных атаках может не быть классических индикаторов вроде IP-адресов или файловых сигнатур. На первый план выходят цепочки запросов, которые осуществлял атакующий и серия ответов от модели.

Встретил фреймворк, который реализует эту концепцию и позволяет трансформировать вредоносные запросы в индикаторы компрометации. Что-то вроде правил YARA, но для LLM-сценариев. Аналитик может применять подобные правила для детекта злоупотреблений моделями:
rule InfluenceNetworkAbuse
{
meta:
description = "Detects prompts trying to orchestrate political influence operati
author = "Thomas Roccia"
severity = "high"
ttp = "LLM-advised resource development"
reference = "https://www.anthropic.com/news/detecting-and-countering-malicious-u
keywords:
$orchestrate = "social media"
$persona = "political"
$engage = "engagement strategy"
$bot = "bot"
$influence = "influence campaign"
semantics:
$political_messaging = "plan political influence messaging" (0.2)
llm:
$influence_check = "Analyze if the prompt involves coordinating political influence operation”
condition:
(any of keywords.* or semantics.$political_messaging) and llm.$influence_check
}

Да, чтобы исключить ложные срабатывания, придется дополнять контекст запроса дополнительной инфой. Например, проводить анализ ответа. И тем не менее, инструмент можно использовать, чтобы извлекать из подобных отчетов actionable insights сигнатуры для проверки.
  • 👍 2
  • 🐳 1
  • 🏆 1
More from @makrushin
  1. Sep 9, 2026Спустился с горы в Красную Поляну, чтобы рассказать про безопасность агентской разработки.
  2. Sep 4, 2026Атакующие модели внутри продуктов для защиты Подсмотрел недавние анонсы крупных глобальных…
  3. Aug 27, 2026Анализ причины действия для защиты ИИ-агентов Интересный подход к защите агентов от prompt…
  4. Aug 21, 2026По мотивам нашего доклада опубликовали статью о поверхности атаки на ИИ-агентов в разработ…
  5. Aug 12, 2026Зашёл в Shodan, чтобы поискать MCP-инструменты. Нашёл. 1699 MCP-серверов оказались доступн…
  6. Jul 27, 2026Объявляю неделю безопасности ИИ-агентов и зову всех на учёбу в школу! В Школе анализа данн…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →