AI Coding Agent Security Benchmark
Всем привет!
Команда Endor Labs задалась вопросом насколько хорошо AI пишет безопасный код.
Для этого они провели анализ 13 агентов и моделей с использованием SusVibes Benchmark.
200 задач из 108 open-source проектов, написанных на Python. При этом измерялась не только безопасность, но и корректное (ожидаемое) функционирование результата.
Из ключевых результатов можно отметить:
🍭 Существует «разрыв» между корректным функционированием и безопасностью
🍭 Модели стали сильно лучше писать код с точки зрения работоспособности, но не безопасности
🍭 Агенты «жульничают» 😅 Да, бывало так, что они просто находили подходящее решение вместо reasoning
🍭 Одна и та же модель может вести себя по-разному при работе с разными агентами
🍭 Та модель, что лучше всех справляется с функциональной частью может быть не самой лучшей с точки зрения ИБ
И это далеко не всё, что есть в исследовании. Рассматривались следующие модели: Claude Sonnet, Kimi, Gemini, GPT.
Кто и в чём победил? Ответы есть в статье, как и множество деталей о проведённой работе.
Рекомендуем к ознакомлению!
P.S. Материал опубликован в апреле и уточнён в мае 2026 года. Это важно учитывать, ведь, увы, подобные исследования «устаревают» достаточно быстро.
Но! Это не делает их менее интересными ☺️
Post #1582
653