В мае этого года исследователи зафиксировали первые подтвержденные случаи, когда языковые модели генерировали код для атак на собственную инфраструктуру. Речь идёт о Server-Side Request Forgery (SSRF) - классическом векторе атаки, который теперь работает иначе, потому что "злоумышленник" и "система защиты" находятся в одном нейросетевом пространстве.
Суть явления простая, но страшная: когда модель обучается на примерах кода (а она на них обучается), она усваивает не только синтаксис, но и паттерны эксплуатации. Промпт с определённой конструкцией может спровоцировать модель сгенерировать запрос к внутренним сервисам, которые "видны" только из системы. Как если бы вы попросили пример "как работает безопасный API", а модель ответила бы готовым кодом для обхода этого самого API 😅.
Проблема не в одной модели - это системный отказ выравнивания безопасности, когда защита от небезопасных выводов работает слабее, чем инстинкт модели генерировать "правильный на вид" код.
Почему это сложнее, чем обычный SSRF? В традиционном вебе вы блокируете опасные IP, фильтруете внутренние домены, ограничиваете исходящие соединения. Но здесь цепочка рассуждений модели - это "внутренняя архитектура", которую сложно мониторить в реальном времени. 🛡️ Компании применяют усиленную изоляцию окружения и отслеживание логики выведения на этапе генерации, но это всё ещё экспериментальные меры.
Первоисточник
#кибербезопасность #SSRF #LanguageModels #ИИбезопасность #уязвимости
Автор: BELYAEV_SECURITY