TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #511 191
🔐 Уязвимости современных LLM-агентов: как атакуют и как защищаются 🤖

Большие языковые модели (LLM) всё чаще применяются в бизнесе, автоматизации и даже в системах принятия решений. Но вместе с удобством приходит и новая угроза — атаки на LLM.
Вспоминаем, какие существуют способы взлома и как защититься.

🎯 Зачем атакуют LLM?

Атаки делятся на 2 категории:
1⃣ Вытащить запретный контент — например, заставить LLM рассказать, как собрать бомбу или сломать пароль.
2⃣ Заставить LLM делать что-то вредоносное — оформить заказ, слить данные, обойти аутентификацию.

💥 Кейс: чат-бот от Chevrolet предложил автомобиль за $1 — из-за грамотно сформулированного запроса. Компания была вынуждена выполнить обещание.

🧨 Какие методы используют хакеры?

➖Игра с языками: пишут запросы на редких языках или с грамматическими ошибками, чтобы обмануть фильтры.
➖Перестановка слов: нарушают привычную структуру фраз, но сохраняют смысл.
➖Фейковые доказательства: подсовывают фальшивые чеки, хэши, ссылки.
➖Ссылки на авторитетные сайты: чтобы ввести модель в заблуждение и повысить «доверие».

🛡️ Как защищаются разработчики?

➖Обучение на примерах атак: в датасеты включают запросы-хулиганы и корректные реакции на них.
➖Более умные фильтры: проверка смысла, контекста и поведенческой логики.
➖Мониторинг: отслеживают странные ответы (например, с высокой энтропией), чтобы выявлять обходы фильтров.

📌 LLM-агенты всё чаще интегрируются в финтех, госуслуги, техподдержку. Их скомпрометация — это:
утечка данных,
репутационные и финансовые риски,
прямое вмешательство в бизнес-процессы.

🛡 Защитить LLM — значит обезопасить не только модель, но и весь цифровой бизнес. Это требует постоянного аудита, дообучения и внимания к поведенческой безопасности модели.

🔗 Подробнее на Habr: Статья

Stay secure and read SecureTechTalks 📚

#SecureTechTalks #LLM #PromptInjection #AI #Cybersecurity #RedTeam #AIhacking #LLMsecurity
  • ❤ 1
More from @securetechtalks
  1. Oct 7, 2026🧨 AI Agent Gateway: шлюз, чтобы агент не таскал ключи по всем MCP Tuskira открыла исходны…
  2. Oct 6, 2026🧨 Два безопасных Skill могут собрать RCE Новое исследование и новая проблема: каждый навы…
  3. Oct 5, 2026🧨 OWASP Noir: карта API прямо из исходного кода OWASP Noir - это open source SAST инструм…
  4. Oct 2, 2026🧨 AI сокращает путь от найденной уязвимости до реальной атаки Google Threat Intelligence…
  5. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  6. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →