🔥 CyberSOCEval - большой «экзамен» для ИИ в кибербезопасности
В кибербезопасности любят цифры и факты. Но что делать, когда речь идёт не о вредоносах, а о возможностях LLM-моделей?
CrowdStrike представили то, чего давно ждали: CyberSOCEval — бенчмарк, проверяющий, на что реально способны ИИ в задачах анализа вредоносного ПО и Threat Intelligence.
🦠 Динамический анализ малвари
Исследователи взяли коллекцию сэмплов:
💣 вымогатели
🕵️ инфостилеры
🖥 RAT
и другие.
Все они были прогнаны через CrowdStrike Falcon® Sandbox (Hybrid Analysis), отчёты получены в JSON.
👉 На основе этих данных Llama 3.2 90B сгенерировала 609 тестов с множественным выбором, которые проверили вручную.
Моделям нужно было понять динамику: какие процессы запускаются, куда идёт трафик, что меняется в системе.
📑 Threat Intelligence reasoning
Здесь всё интереснее:
📄 45 TI-отчётов от CrowdStrike, АНБ и других;
🖼 PDF превращены в PNG (!);
🧩 вопросы строятся на основе графов «актор → софт → цель».
Итого: 588 вопросов, часть вручную составленных (где без анализа изображений никак).
📊 Результаты моделей
🦾 Малварь (15-28%)
🥇 Claude-3.7-Sonnet
🥈 llama-4-maverick
🥉 Deepseek-R1
📡 TI (43-53%)
🥇 gpt-o3
🥈 llama-4-maverick (обошёл gpt-4o и gemini-2.5-pro)
🤯 даже «малыш» llama-4-scout обогнал gpt-4o.
🤯 Инсайты исследования
🗑 Удаление «мусора» из отчётов почти не снижает качество.
📜 Замена картинок на текст = +10 п.п. точности.
🧠 Добавление reasoning почти не улучшает ответы.
🎭 Смешанные впечатления
🔹 С одной стороны — это шаг к стандарту оценки LLM в кибере.
🔹 С другой — выглядит как «чья модель лучше парсит CrowdStrike Falcon® отчёты».
⚠️ Странности:
- не указано количество сэмплов;
- Deepseek-R1 не протестирован на TI;
- отчёты в картинках - сомнительное решение;
- много геополитики в вопросах.
🚀 Куда дальше?
CyberSOCEval пока «сырая» версия, но это только начало. Ждём:
- больше датасетов,
- меньше синтетики,
- больше практических задач.
Stay secure and read SecureTechTalks 📚
#AI #LLM #CyberSOCEval #MalwareAnalysis #ThreatIntelligence #SecureTechTalks
Post #609
196

- 👍 2