🗿Могут ли ИИ-агенты пропустить вредоносный код?
Вообще говоря, могут. Смотреть на это лучше всего в примерах, чтобы понимать, как делать не надо, чем потом работать с последствиями.
Где посмотреть. Разработчик команды HiveTrace Red Никита Беляевский написал материал, где воспроизвел и разобрал эксперимент с агентом, которому предложили поработать с вредоносным репозиторием.
Что в статье❓
✔️ Процесс: как агент анализирует незнакомый репозиторий и ищет подозрительный код;
✔️ Причины изменений в поведении: почему наличие исходного кода, README и других «безопасных» артефактов может повлиять на решение агента;
✔️ Действия: как агент может обнаружить потенциальную угрозу, но после дополнительного анализа решить, что она безопасна;
Эксперимент показывает занчимую особенность агентных систем: обнаружение потенциальной угрозы ещё не означает, что агент правильно оценит риск и остановится перед опасным действием.
➡️ Читать статью на Хабре:
«Рэд-флаг, который ИИ-агент проигнорировал»
Post #251
912
- ❤ 9
- 🔥 6
- 🌚 2