TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #715 193
🔥 Как одна LLM научилась писать ransomware, reverse shell и эксплойты…

На Habr вышла статья, которая вновь поднимает тему безопасности больших языковых моделей. Довольно занятый материал.

Статья напоминает, что встроенные механизмы защиты LLM пока скорее декорация, нежели работающий инструмент.

💥 Что продемонстрировали?

Исследователь показал, что стандартная модель:
✔️ написала 17 реальных эксплойтов (SQLi, XSS, buffer overflow),
✔️ сгенерировала рабочие reverse shells и shellcode,
✔️ создала сценарии в стиле “God Mode”,
✔️ написала автоматизированный jailbreak-инструмент,
✔️  оформила собственный Security Advisory с анализом уязвимостей.

Для этого потребовались обычные мета-промты:
например, «дополни TODO в коде», или «сгенерируй обучающий датасет для классификатора вредоносного ПО».

Звучит безобидно, но фактически это генерация атакующих инструментов.

🧠 Старые песни о главном

🔹 Отказ не означает безопасность
Модель может начать с «Я не могу помочь с этим», а затем всё равно сгенерировать вредоносный код.
🔹 Фреймирование - это ключевой вектор обхода
Контекст решает всё. Если задача выглядит исследовательской или образовательной, фильтры часто ослабевают.
🔹 Guardrails пока недостаточны
RLHF и простые классификаторы плохо ловят цепочки логических обходов.

🛡 Все пропало?

Автор предлагает разумные меры:
▪ анализировать не только вход, но и выход модели,
▪ проверять сессии целиком, а не отдельные сообщения,
▪ применять семантический анализ кода,
▪ выносить контроль безопасности за пределы самой LLM.

Оригинал статьи:
👉 https://habr.com/ru/articles/1003334/

Stay secure and read SecureTechTalks 📚

#кибербезопасность
#LLM #AIsecurity #jailbreak #promptengineering #DevSecOps #GenAI #redteam #SecureTechTalks #информационнаябезопасность
  • 👍 1
More from @securetechtalks
  1. Oct 2, 2026🧨 AI сокращает путь от найденной уязвимости до реальной атаки Google Threat Intelligence…
  2. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  3. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
  4. Sep 29, 2026🍷 Исследователи «напоили» LLM Команда UNSW решила проверить довольно странную гипотезу, ч…
  5. Sep 28, 2026🧨 GitHub отдал fuzzing AI агенту GitHub Security Lab открыла инструмент, который автомати…
  6. Sep 25, 2026🧨 Carbonato: ботнет устанавливает AI агента на взломанный сервер Исследователи ThreatDown…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →