TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #502 237
🧠 Как далеко продвинулись ИИ в экспертизе кибербезопасности?

⚡ В эпоху ChatGPT, Gemini и других LLM возникает закономерный вопрос: а могут ли ИИ действительно стать полноценными киберэкспертами?

Исследователи из лаборатории Zhongguancun и университета Цинхуа не стали гадать и создали CSEBenchmark — самый глубокий на сегодня тест для LLM в сфере кибербезопасности.

📚 Что такое CSEBenchmark?

CSEBenchmark — это:
➖345 кибер-навыков, которые должен знать специалист
➖7 ключевых доменов знаний: от основ IT до облаков и программирования
➖11 050 вопросов (да, серьёзно!)
➖Учёт разных типов знаний: фактические, концептуальные, процедурные
➖Подготовка с использованием GPT-4, но с ручной проверкой — 772 часа труда!

⚙️ Кого тестировали?

12 моделей, включая:
GPT-4o, GPT-4-Turbo, GPT-3.5
LLaMA 3.1, 3.2
Deepseek V3, Deepseek R1
Qwen 2.5
Mixtral и другие

Были учтены не только точность ответов, но и устойчивость к перетасовке вариантов, тип взаимодействия (Zero/Few/CoT-shot) и даже семантическая нагрузка вопросов.

🏆 Результаты: кто справился?

🥇GPT-4o — лидер среди закрытых моделей с точностью 85.42%

🥈Deepseek-V3 — топ среди open-source (84.92%)

🥉Qwen-2.5-72B — золотая середина между качеством и размером (84.4%)

👌Остальные модели отстали — до 52.95% точности

Но даже лучшие модели покрывают лишь 70%–75% знаний, необходимых для работы реального специалиста.

🚧 Где проваливаются LLM?

➖Процедурные знания (использование инструментов, команд, эксплуатация уязвимостей) — самое слабое место
Wireshark, nmap, Metasploit, Burp Suite, SQL — часто ошибаются
➖Даже базовые вещи вроде различий между P2P и локальной аутентификацией даются с трудом
➖ Прямо сейчас ни одна модель не справляется на уровне Senior Security Engineer

📈 А можно ли ИИ улучшить?

Да! Использовав выявленные пробелы, исследователи применили Retrieval-Augmented Generation (RAG):
- Векторная база знаний на основе Milvus
- Автоматическая подгрузка недостающего контекста
- Улучшение точности до 84% на задачах уязвимостей и анализа угроз
- Особенно эффективно для моделей средней мощности (LLaMA 3.2, 3.1)

👩‍💻 Как модели соответствуют реальным вакансиям?

Оценивалось соответствие знаниям, требуемым на позициях в:
- Google (Intelligence Analyst, Red Team Consultant)
- Amazon (Privacy Engineer, Security Engineer)
- Microsoft (Red Team Security Engineer)

Ни одна модель не набрала более 90% соответствия. Самые близкие к требованиям — GPT-4o и Deepseek-V3, но у каждой модели своя “зона силы”.

🔍 Выводы

➖LLM уже умеют многое, но пока они — скорее ассистенты, чем эксперты
➖Без прокачки процедурных навыков им не стать полноценными аналитиками
➖Модель нужно выбирать под конкретную роль, а не по хайпу

Stay secure and read SecureTechTalks 📚

#SecureTechTalks #CyberSecurity #LLM #AI #Benchmark #CSEBenchmark #GPT4 #Deepseek #RAG #RedTeam #SOC #InfoSec #ChatGPT
More from @securetechtalks
  1. Oct 7, 2026🧨 AI Agent Gateway: шлюз, чтобы агент не таскал ключи по всем MCP Tuskira открыла исходны…
  2. Oct 6, 2026🧨 Два безопасных Skill могут собрать RCE Новое исследование и новая проблема: каждый навы…
  3. Oct 5, 2026🧨 OWASP Noir: карта API прямо из исходного кода OWASP Noir - это open source SAST инструм…
  4. Oct 2, 2026🧨 AI сокращает путь от найденной уязвимости до реальной атаки Google Threat Intelligence…
  5. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  6. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →