🧠 Как далеко продвинулись ИИ в экспертизе кибербезопасности?
⚡ В эпоху ChatGPT, Gemini и других LLM возникает закономерный вопрос: а могут ли ИИ действительно стать полноценными киберэкспертами?
Исследователи из лаборатории Zhongguancun и университета Цинхуа не стали гадать и создали CSEBenchmark — самый глубокий на сегодня тест для LLM в сфере кибербезопасности.
📚 Что такое CSEBenchmark?
CSEBenchmark — это:
➖345 кибер-навыков, которые должен знать специалист
➖7 ключевых доменов знаний: от основ IT до облаков и программирования
➖11 050 вопросов (да, серьёзно!)
➖Учёт разных типов знаний: фактические, концептуальные, процедурные
➖Подготовка с использованием GPT-4, но с ручной проверкой — 772 часа труда!
⚙️ Кого тестировали?
12 моделей, включая:
GPT-4o, GPT-4-Turbo, GPT-3.5
LLaMA 3.1, 3.2
Deepseek V3, Deepseek R1
Qwen 2.5
Mixtral и другие
Были учтены не только точность ответов, но и устойчивость к перетасовке вариантов, тип взаимодействия (Zero/Few/CoT-shot) и даже семантическая нагрузка вопросов.
🏆 Результаты: кто справился?
🥇GPT-4o — лидер среди закрытых моделей с точностью 85.42%
🥈Deepseek-V3 — топ среди open-source (84.92%)
🥉Qwen-2.5-72B — золотая середина между качеством и размером (84.4%)
👌Остальные модели отстали — до 52.95% точности
Но даже лучшие модели покрывают лишь 70%–75% знаний, необходимых для работы реального специалиста.
🚧 Где проваливаются LLM?
➖Процедурные знания (использование инструментов, команд, эксплуатация уязвимостей) — самое слабое место
Wireshark, nmap, Metasploit, Burp Suite, SQL — часто ошибаются
➖Даже базовые вещи вроде различий между P2P и локальной аутентификацией даются с трудом
➖ Прямо сейчас ни одна модель не справляется на уровне Senior Security Engineer
📈 А можно ли ИИ улучшить?
Да! Использовав выявленные пробелы, исследователи применили Retrieval-Augmented Generation (RAG):
- Векторная база знаний на основе Milvus
- Автоматическая подгрузка недостающего контекста
- Улучшение точности до 84% на задачах уязвимостей и анализа угроз
- Особенно эффективно для моделей средней мощности (LLaMA 3.2, 3.1)
👩💻 Как модели соответствуют реальным вакансиям?
Оценивалось соответствие знаниям, требуемым на позициях в:
- Google (Intelligence Analyst, Red Team Consultant)
- Amazon (Privacy Engineer, Security Engineer)
- Microsoft (Red Team Security Engineer)
Ни одна модель не набрала более 90% соответствия. Самые близкие к требованиям — GPT-4o и Deepseek-V3, но у каждой модели своя “зона силы”.
🔍 Выводы
➖LLM уже умеют многое, но пока они — скорее ассистенты, чем эксперты
➖Без прокачки процедурных навыков им не стать полноценными аналитиками
➖Модель нужно выбирать под конкретную роль, а не по хайпу
Stay secure and read SecureTechTalks 📚
#SecureTechTalks #CyberSecurity #LLM #AI #Benchmark #CSEBenchmark #GPT4 #Deepseek #RAG #RedTeam #SOC #InfoSec #ChatGPT
Post #502
237
