TGViewer
AI Security Lab AI Security Lab @aisecuritylab · 2.22K subscribers
Post #251 912
🗿Могут ли ИИ-агенты пропустить вредоносный код?

Вообще говоря, могут. Смотреть на это лучше всего в примерах, чтобы понимать, как делать не надо, чем потом работать с последствиями.

Где посмотреть. Разработчик команды HiveTrace Red Никита Беляевский написал материал, где воспроизвел и разобрал эксперимент с агентом, которому предложили поработать с вредоносным репозиторием.

Что в статье

✔️ Процесс: как агент анализирует незнакомый репозиторий и ищет подозрительный код;
✔️ Причины изменений в поведении: почему наличие исходного кода, README и других «безопасных» артефактов может повлиять на решение агента;
✔️ Действия: как агент может обнаружить потенциальную угрозу, но после дополнительного анализа решить, что она безопасна;

Эксперимент показывает занчимую особенность агентных систем: обнаружение потенциальной угрозы ещё не означает, что агент правильно оценит риск и остановится перед опасным действием.

➡️ Читать статью на Хабре:
«Рэд-флаг, который ИИ-агент проигнорировал»
  • ❤ 9
  • 🔥 6
  • 🌚 2
More from @aisecuritylab
  1. Sep 18, 2026Post #260
  2. Sep 14, 2026Открытый вебинар про интерепретируемость агентов совместно со Stepik. Завтра (вторник, 18:…
  3. Sep 11, 2026Post #258
  4. Sep 11, 2026Наш исследователь — контрибьютор SAE Lens 🎉 PR Егора Емельянова, исследователя нашей лабо…
  5. Sep 7, 2026🍂 Записи докладов наших студенток, выступавших на международной конференции AINL 2026 Про…
  6. Sep 4, 2026Post #255
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →