TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #609 196
🔥 CyberSOCEval - большой «экзамен» для ИИ в кибербезопасности

В кибербезопасности любят цифры и факты. Но что делать, когда речь идёт не о вредоносах, а о возможностях LLM-моделей?

CrowdStrike представили то, чего давно ждали: CyberSOCEval — бенчмарк, проверяющий, на что реально способны ИИ в задачах анализа вредоносного ПО и Threat Intelligence.

🦠 Динамический анализ малвари

Исследователи взяли коллекцию сэмплов:
💣 вымогатели
🕵️ инфостилеры
🖥 RAT
и другие.

Все они были прогнаны через CrowdStrike Falcon® Sandbox (Hybrid Analysis), отчёты получены в JSON.

👉 На основе этих данных Llama 3.2 90B сгенерировала 609 тестов с множественным выбором, которые проверили вручную.

Моделям нужно было понять динамику: какие процессы запускаются, куда идёт трафик, что меняется в системе.

📑 Threat Intelligence reasoning

Здесь всё интереснее:
📄 45 TI-отчётов от CrowdStrike, АНБ и других;
🖼 PDF превращены в PNG (!);
🧩 вопросы строятся на основе графов «актор → софт → цель».
Итого: 588 вопросов, часть вручную составленных (где без анализа изображений никак).

📊 Результаты моделей

🦾 Малварь (15-28%)
🥇 Claude-3.7-Sonnet
🥈 llama-4-maverick
🥉 Deepseek-R1

📡 TI (43-53%)
🥇 gpt-o3
🥈 llama-4-maverick (обошёл gpt-4o и gemini-2.5-pro)
🤯 даже «малыш» llama-4-scout обогнал gpt-4o.

🤯 Инсайты исследования

🗑 Удаление «мусора» из отчётов почти не снижает качество.
📜 Замена картинок на текст = +10 п.п. точности.
🧠 Добавление reasoning почти не улучшает ответы.

🎭 Смешанные впечатления

🔹 С одной стороны — это шаг к стандарту оценки LLM в кибере.
🔹 С другой — выглядит как «чья модель лучше парсит CrowdStrike Falcon® отчёты».

⚠️ Странности:
- не указано количество сэмплов;
- Deepseek-R1 не протестирован на TI;
- отчёты в картинках -  сомнительное решение;
- много геополитики в вопросах.

🚀 Куда дальше?

CyberSOCEval пока «сырая» версия, но это только начало. Ждём:
- больше датасетов,
- меньше синтетики,
- больше практических задач.

Stay secure and read SecureTechTalks 📚

#AI #LLM #CyberSOCEval #MalwareAnalysis #ThreatIntelligence #SecureTechTalks
  • 👍 2
More from @securetechtalks
  1. Oct 2, 2026🧨 AI сокращает путь от найденной уязвимости до реальной атаки Google Threat Intelligence…
  2. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  3. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
  4. Sep 29, 2026🍷 Исследователи «напоили» LLM Команда UNSW решила проверить довольно странную гипотезу, ч…
  5. Sep 28, 2026🧨 GitHub отдал fuzzing AI агенту GitHub Security Lab открыла инструмент, который автомати…
  6. Sep 25, 2026🧨 Carbonato: ботнет устанавливает AI агента на взломанный сервер Исследователи ThreatDown…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →