Aikido Security в очередной раз сравнили последние версии ИИ-моделей с точки зрения способности обнаружения уязвимостей в коде🥇🥈🥉
В последнем тестировании смотрели на десять моделей, которым скормили наборы данных с 32 "свежими" уязвимостями: каждой модели давали по три попытки с максимум 30 итерациями для нахождения уязвимости (без доступа в сеть Интернет).
Дублировать результаты для каждой модели нет смысла: всё понятно из статьи и графиков, а после выхода новых версий моделей результаты изменятся. Поэтому подсвечу обобщённые выводы из сравнения открытых и закрытых моделей:
🔗Объединение (pooling) результатов нескольких независимых прогонов значительно расширяет общий процент выявления уязвимостей – ИИ-модели по своей природе показывают нестабильные результаты от запуска к запуску, предлагая разные пути решения задачи, что может сыграть на руку при задаче поиска уязвимостей.
🔗Стратегия многократного запуска более дешевых и эффективных (с открытыми весами) моделей оказывается экономически более выгодной и результативной, чем один запуск дорогой коммерческой (закрытой) модели.
🔗Главной проблемой открытых моделей становится высокий уровень ложноположительных сработок, что увеличивает затраты (нагрузку) на последующий этап постпроверки и фильтрации шума. Дорогие коммерческие модели, напротив, окупают свою стоимость снижением затрат на последующий триаж, благодаря более высокой точности.
🔗Для достижения высокой эффективности работы ИИ-моделей в любом случае требуется качественный управляющий слой оркестрации (harness), который управляет агентом, координирует шаги проверок, интерпретирует выводы и отсекает ложные срабатывания. Модели с открытыми весами особенно чувствительны к качеству такой программной обвязки.
#ai #benchmark #cve #vulnerability #harness #llm #triage
Post #835
1.32K




- 👍 4
- 🔥 1