TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #679 201
🧠 ИИ и оценка уязвимостей: революция или скам?

Исследователи проверили, могут ли современные большие языковые модели независимо оценивать уязвимости, то есть определять их критичность по описанию.

📊 Как тестировали?

Команда прогнала 31 000+ CVE-описаний через шесть крупных LLM:
• GPT-4o
• GPT-5
• Llama 3.3
• Gemini 2.5 Flash
• DeepSeek R1
• Grok 3

❗️Модели оценивали исключительно текст описания уязвимости. Им не давали:
✔ названия продуктов,
✔ версий ПО,
✔ идентификаторы CVE,
✔ данные поставщиков

Это было сделано специально, чтобы исключить «поиск по шаблону» и заставить ИИ логически рассуждать на основе текста.

То есть задача была не просто прочитать описание, а воссоздать ключевые метрики CVSS, которые определяют приоритет реагирования на уязвимость.

🧩 Где ИИ эффективен?

Модели показали лучшие результаты там, где язык описания был прямолинейным и содержал явные сигналы:
🔹 Attack Vector (находится ли уязвимость в сети или локально). Примерно 89% точности у Gemini и GPT-5.
🔹 User Interaction (нужен ли пользовательский ввод/клик для эксплуатации). Схожие результаты.

Такие аспекты часто прямо указаны в описаниях CVE.

Кроме того:
🔸 Confidentiality Impact (угроза утечки данных) и
🔸 Integrity Impact (изменение данных)
тоже были оценены достаточно успешно. GPT-5 показывал 70+ % точности здесь.
👉 То есть когда модель видит явные сигналы в тексте, она может прилично предсказывать, что именно представляет собой уязвимость. Это может помочь аналитикам быстро отсеивать тривиальные случаи.

😬 Где ИИ слаб

Явные ограничения:
❗ Availability Impact (влияние на доступность системы). Результаты чуть ниже (≈68 % у GPT-5), потому что описания редко точно объясняют, насколько нарушение службы критично.
❗ Privileges Required (необходимые привилегии). Модели путают «отсутствие» и «низкий уровень», потому что тексты часто не содержат чётких указаний.
❗ Attack Complexity  предугадывается плохо, в основном из-за перекоса данных в сторону «низкой сложности».
📌 Анализ ошибок также показал:
29 % CVE были неправильно оценены всеми моделями одновременно по Availability Impact.

В других метриках 4 из 6 моделей согласовывались в неправильных ответах до 36 % случаев, что говорит о систематической ошибке, а не случайности.

🤝 Ансамбли моделей

Исследователи попробовали объединить предсказания всех шести моделей в meta classifier. Это дало небольшие улучшения, но не решило фундаментальной проблемы:
отсутствие информации в описании всё ещё мешает точному пониманию угрозы.

🧠 Контекст наше всё

Самый важный вывод исследования:
👉 LLM могут быть полезны для предварительной оценки, но на текущий момент они не заменят человека или полноценные системы анализа контекста и метаданных.

🔗 Оригинал исследования: LLMs can assist with vulnerability scoring, but context still matters.

Stay secure and read SecureTechTalks 📚

#SecureTechTalks #AIsecurity #LLMs #CVE #VulnerabilityAssessment #CyberSecurity #Infosec #AIinSec #ThreatIntel #ContextMatters #AutomationLimits #CyberResearch
  • 👍 2
  • 🔥 1
More from @securetechtalks
  1. Oct 2, 2026🧨 AI сокращает путь от найденной уязвимости до реальной атаки Google Threat Intelligence…
  2. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  3. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
  4. Sep 29, 2026🍷 Исследователи «напоили» LLM Команда UNSW решила проверить довольно странную гипотезу, ч…
  5. Sep 28, 2026🧨 GitHub отдал fuzzing AI агенту GitHub Security Lab открыла инструмент, который автомати…
  6. Sep 25, 2026🧨 Carbonato: ботнет устанавливает AI агента на взломанный сервер Исследователи ThreatDown…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →