Атаки на LLM - это уже не про "сломать чатик"
OWASP в свежем Top 10 для LLM Applications поставил prompt injection на первое место, а рядом отдельно вынес -раскрытие конфиденциальной информации, цепочка поставок и чрезмерное вмешательство - то есть вызовы инструментов, пишет OWASP. - то есть риск давно живёт не только в тексте, но и в том, что модель умеет делать руками через tool-calls.
Самая неприятная часть в том, что прямой injection уже не выглядит главным сюрпризом. Гораздо опаснее непрямой атаки через RAG, документы, письма, веб-страницы и вообще любой внешний контент, который модель читает как "данные", но по факту может проглотить как инструкцию. В 2026 это и есть нормальный боевой сценарий: уязвимость не в одном промпте, а в цепочке контекстов, прав и автоматических действий пишет Cybersecify.
На практике лучше всего работает скучная архитектура, а не "умный" промпт. Разделили доверенные и недоверенные источники, обрезали права у агентa, все write/send/pay перевели через явное подтверждение человеком, а каждый tool-call стали логировать так, чтобы потом можно было восстановить цепочку инцидента. После этого разговор с командой обычно меняется: вместо "давайте сделаем модель посильнее" появляется вопрос, какие именно действия она вообще имеет право совершать.
И вот тут атаки на LLM становятся хорошей лакмусовой бумажкой для зрелости всей AI-функции. Если систему можно увести одной строкой в чужом документе, то проблема не в модели - проблема в том, что ей уже слишком доверили.
Post #519
151
Forwarded from Алексей Чернобровов
