TGViewer
AlexRedSec AlexRedSec @alexredsec · 4.01K subscribers
Post #835 1.32K
Aikido Security в очередной раз сравнили последние версии ИИ-моделей с точки зрения способности обнаружения уязвимостей в коде🥇🥈🥉
В последнем тестировании смотрели на десять моделей, которым скормили наборы данных с 32 "свежими" уязвимостями: каждой модели давали по три попытки с максимум 30 итерациями для нахождения уязвимости (без доступа в сеть Интернет).

Дублировать результаты для каждой модели нет смысла: всё понятно из статьи и графиков, а после выхода новых версий моделей результаты изменятся. Поэтому подсвечу обобщённые выводы из сравнения открытых и закрытых моделей:
🔗Объединение (pooling) результатов нескольких независимых прогонов значительно расширяет общий процент выявления уязвимостей – ИИ-модели по своей природе показывают нестабильные результаты от запуска к запуску, предлагая разные пути решения задачи, что может сыграть на руку при задаче поиска уязвимостей.
🔗Стратегия многократного запуска более дешевых и эффективных (с открытыми весами) моделей оказывается экономически более выгодной и результативной, чем один запуск дорогой коммерческой (закрытой) модели.
🔗Главной проблемой открытых моделей становится высокий уровень ложноположительных сработок, что увеличивает затраты (нагрузку) на последующий этап постпроверки и фильтрации шума. Дорогие коммерческие модели, напротив, окупают свою стоимость снижением затрат на последующий триаж, благодаря более высокой точности.
🔗Для достижения высокой эффективности работы ИИ-моделей в любом случае требуется качественный управляющий слой оркестрации (harness), который управляет агентом, координирует шаги проверок, интерпретирует выводы и отсекает ложные срабатывания. Модели с открытыми весами особенно чувствительны к качеству такой программной обвязки.

#ai #benchmark #cve #vulnerability #harness #llm #triage
  • 👍 4
  • 🔥 1
More from @alexredsec
  1. Sep 17, 2026Самые переоцененные и вызывающие наименьшее доверие концепции и заявления в ИБ👎 Тут в исс…
  2. Sep 12, 2026А в Steam сейчас ещё идёт распродажа игр, где можно примерить на себя роль хакера или прог…
  3. Sep 10, 2026В интересное время живем: с одной стороны, классические инсайдерские угрозы от сотрудников…
  4. Sep 7, 2026В конце августа агентство CISA выпустило аналитический отчет об угрозах, связанных с экспл…
  5. Aug 31, 2026document post
  6. Aug 31, 2026SANS опубликовал ежегодное исследование, посвященное повышению осведомленности и культуре…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →