Исследователи обнаружили любопытную деталь в новой кампании Mini Shai-Hulud, Miasma и Hades. Авторы вредоносного кода начали добавлять в свои пакеты текстовые блоки про биологическое и ядерное оружие. Не потому, что они внезапно заинтересовались массовым поражением человечества.
Цель намного современнее.
Если файл попадёт на анализ к системе, использующей LLM, есть шанс, что модель увидит чувствительный контент, решит, что перед ней опасный запрос, и откажется проводить анализ. Проще говоря, вредоносная программа пыталась спрятаться за собственным safety-фильтром искусственного интеллекта.
Десятилетиями вредоносный код писался для компьютеров и маскировался от компьютеров. Потом появились методы, рассчитанные на обман исследователей. Теперь появился новый класс техник, рассчитанных на обман ИИ.
Фактически мы наблюдаем первые признаки того, что злоумышленники начали воспринимать большие языковые модели как полноценную часть защитной инфраструктуры. Если раньше нужно было обходить сигнатуры антивируса или эвристики песочницы, то теперь появляется ещё одна поверхность атаки — поведение модели.
Последние несколько лет крупнейшие разработчики моделей соревновались в том, кто лучше научит ИИ отказываться отвечать на опасные запросы. Но любой механизм отказа можно превратить в механизм уклонения. Если защитная система автоматически отдаёт подозрительный файл модели на анализ, злоумышленник рано или поздно попробует заставить эту модель замолчать.
Собственно, это и произошло.
Нельзя просто взять LLM, поставить её в центр процесса анализа и надеяться, что всё будет хорошо. Потому что как только модель становится частью защитного контура, она автоматически становится целью атакующих.
Мы только начинаем видеть первые эксперименты в этом направлении.
@gostev_future
Post #348
4.36K

- 🔥 9
- 👍 8
- ❤🔥 1
- 👏 1
- 😱 1
- 🎃 1