TGViewer
DevSecOps Talks DevSecOps Talks @devsecops_weekly · 8.04K subscribers
Post #1582 653
AI Coding Agent Security Benchmark

Всем привет!

Команда Endor Labs задалась вопросом насколько хорошо AI пишет безопасный код.

Для этого они провели анализ 13 агентов и моделей с использованием SusVibes Benchmark.

200 задач из 108 open-source проектов, написанных на Python. При этом измерялась не только безопасность, но и корректное (ожидаемое) функционирование результата.

Из ключевых результатов можно отметить:
🍭 Существует «разрыв» между корректным функционированием и безопасностью
🍭 Модели стали сильно лучше писать код с точки зрения работоспособности, но не безопасности
🍭 Агенты «жульничают» 😅 Да, бывало так, что они просто находили подходящее решение вместо reasoning
🍭 Одна и та же модель может вести себя по-разному при работе с разными агентами
🍭 Та модель, что лучше всех справляется с функциональной частью может быть не самой лучшей с точки зрения ИБ

И это далеко не всё, что есть в исследовании. Рассматривались следующие модели: Claude Sonnet, Kimi, Gemini, GPT.

Кто и в чём победил? Ответы есть в статье, как и множество деталей о проведённой работе.

Рекомендуем к ознакомлению!

P.S. Материал опубликован в апреле и уточнён в мае 2026 года. Это важно учитывать, ведь, увы, подобные исследования «устаревают» достаточно быстро.

Но! Это не делает их менее интересными
☺️
Endorlabs Agent Security League: Evaluating the Security of AI-Coded Software | Ebook/Report | Endor Labs AI-generated code passes tests but fails security. This report benchmarks agents, exposing a persistent gap between functional correctness and secure outcomes.
More from @devsecops_weekly
  1. Oct 1, 2026Platform Skills Всем привет! По ссылке доступен GitHub-репозиторий, в котором можно найти…
  2. Sep 30, 2026Vaikora LLM Gateway Всем привет! С повсеместным использованием AI-агентов всё чаще встреча…
  3. Sep 29, 2026Анализ зависимостей и инструментария разработки ПО Всем привет! Анализ ПО начинается не с…
  4. Sep 28, 2026Композиционный анализ C/C++ проектов Всем привет! Разрешить зависимости, сформировать SBoM…
  5. Sep 25, 2026Метрики масштабирования в Kubernetes Всем привет! (Автоматическое) масштабирование – крайн…
  6. Sep 24, 2026Pluto AI: анализ безопасности кода Всем привет! Сегодня хотим рассказать про ещё один скан…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →