🪞 Prompt Injection - почему LLM-агентов невозможно “починить” одним системным промптом
➡️Разбор архитектурной проблемы LLM-систем: модель не умеет жёстко отличать инструкции от данных. Для неё и системный промпт, и письмо пользователя, и HTML со страницы - просто один поток токенов. Именно поэтому prompt injection - это не баг конкретной модели, а фундаментальное ограничение всей архитектуры современных LLM.
➡️Что здесь ломается
⏺LLM не имеет отдельного “защищённого” канала инструкций
⏺System / user / tool роли — статистическая привычка модели, а не жёсткая изоляция
⏺Вредоносный текст обрабатывается тем же механизмом, что и легитимные команды
⏺Атакующий манипулирует не кодом, а контекстом мышления модели
➡️Почему это отличается от SQL-инъекций
⏺В SQL есть формальная грамматика и параметризация
⏺У естественного языка нет строгого разделения “данных” и “команд”
⏺Фраза «отправь файлы» синтаксически ничем не отличается от обычного текста
⏺Модель сама должна решать, является ли инструкция вредоносной
➡️Какие атаки используют на практике
⏺Прямые prompt injection через user input
⏺Косвенные атаки через письма, HTML, документы и tool output
⏺Обфускация инструкций через base64, Unicode, split-context
⏺Многоходовые атаки с постепенным смещением контекста
Читать статью
Rick Academy 🦠 #статья
Post #1839
296