Авторский проект Александра Гостева.
Кибербезопасность, AI и технологический рынок: что происходит, кто на этом заработает и чем всё закончится.
Книга Вирьё моё!
https://www.litres.ru/74050549/
Для связи: alex@agostev.com
Post #358
1.3K
1244-1-3373-1-10-20260615.pdf635.3 KB
Эксперты Сбера и Касперского опубликовали в журнале МГУ «Современные информационные технологии и ИТ-образование» любопытную статью.
Авторы предложили двумерный бенчмарк для LLM (БЯМ) в пентесте: отдельно замерять планирование атаки и её исполнение. Раньше эти навыки смешивали в одну метрику, и было непонятно, где именно проигрывает модель — в голове или в руках.
Протестировано 11 моделей. В планировании лидер — Claude Sonnet 4.5 (78,22%), за ним GPT-5 (73,72%) и Gemini 2.5 Pro (72,16%); хуже всех — Gemini 2.5 Flash (37,66%). В исполнении первые — GPT-5 и Qwen3 Max (по 76,47%), рядом GLM 4.6 и Sonnet 4.5 (73,53%); хуже всех — Llama 3.3 70B (5,88%, в основном из-за провалов в синтаксисе вызова инструментов).
Зафиксированные сбои: галлюцинации (выдуманные IP и флаги решений), уход от задачи (агент DeepSeek бросил повышение привилегий ради решения квадратного уравнения), потеря контекста в длинных сценариях, и курьёз — агент-оценщик сам выполнил задание вместо проверки; авторы это поймали и поправили промпт.
Из списка моделей видно: пока статья готовилась, модели ушли на 1–3 поколения вперёд. Но цель была не зафиксировать сегодняшние цифры, а собрать бенчмарк, применимый и в будущем — датасет и код обещают выложить на GitVerse в открытом доступе.
Тут у меня есть замечания.
CSL-Benchmark собран из 846 шагов 44 отчётов с платформ вроде HackTheBox — открытых и индексируемых. Риск: будущие модели уже видели эти разборы в обучении или просто найдут их поиском. Этот риск авторы вообще не упоминают в ограничениях — а это первое, что убьёт чувствительность бенчмарка: рост баллов будет значить не «модель стала умнее», а «модель выучила ответы».
K-Benchmark прогонялся по одному разу на задачу — доверительные интервалы широкие, точный тест Фишера не находит значимой разницы между соседними моделями в таблице. Значимо они отличаются только от явных отстающих, вроде Llama 3.3 70B. То есть нынешний рейтинг — это точечные оценки, не строгое ранжирование.
Покрытие ATT&CK узкое: 3 тактики из 14 (доступ, закрепление, привилегии), без бокового перемещения, эксфильтрации, Active Directory и облаков — честно признанное самими авторами ограничение.
И момент, который авторы не назвали риском: судья в K-Benchmark — тот же Claude Sonnet 4.5, который заодно сидит в таблице как тестируемый агент (73,53%). Модель частично оценивает саму себя, и нет гарантии, что она не снисходительнее к своему стилю рассуждений. В ограничениях это не обсуждается — хотя ровно об этом риске говорит их же случай, когда оценщик решил задачу за испытуемого.
Как фреймворк — методология переживёт смену моделей: разделение планирования и исполнения, привязка к ATT&CK и проверенный экспертами судья — это здравые решения. А вот конкретные цифры — снимок с коротким сроком жизни: контаминация датасета, слабая статистика и судья-в-доле снизят значимость быстрее, чем хотелось бы. У авторов есть план расширения — больше тактик, AD-окружения, повторные прогоны. Если реализуют — инструмент останется живым.
@gostev_future
Авторы предложили двумерный бенчмарк для LLM (БЯМ) в пентесте: отдельно замерять планирование атаки и её исполнение. Раньше эти навыки смешивали в одну метрику, и было непонятно, где именно проигрывает модель — в голове или в руках.
Протестировано 11 моделей. В планировании лидер — Claude Sonnet 4.5 (78,22%), за ним GPT-5 (73,72%) и Gemini 2.5 Pro (72,16%); хуже всех — Gemini 2.5 Flash (37,66%). В исполнении первые — GPT-5 и Qwen3 Max (по 76,47%), рядом GLM 4.6 и Sonnet 4.5 (73,53%); хуже всех — Llama 3.3 70B (5,88%, в основном из-за провалов в синтаксисе вызова инструментов).
Зафиксированные сбои: галлюцинации (выдуманные IP и флаги решений), уход от задачи (агент DeepSeek бросил повышение привилегий ради решения квадратного уравнения), потеря контекста в длинных сценариях, и курьёз — агент-оценщик сам выполнил задание вместо проверки; авторы это поймали и поправили промпт.
Из списка моделей видно: пока статья готовилась, модели ушли на 1–3 поколения вперёд. Но цель была не зафиксировать сегодняшние цифры, а собрать бенчмарк, применимый и в будущем — датасет и код обещают выложить на GitVerse в открытом доступе.
Тут у меня есть замечания.
CSL-Benchmark собран из 846 шагов 44 отчётов с платформ вроде HackTheBox — открытых и индексируемых. Риск: будущие модели уже видели эти разборы в обучении или просто найдут их поиском. Этот риск авторы вообще не упоминают в ограничениях — а это первое, что убьёт чувствительность бенчмарка: рост баллов будет значить не «модель стала умнее», а «модель выучила ответы».
K-Benchmark прогонялся по одному разу на задачу — доверительные интервалы широкие, точный тест Фишера не находит значимой разницы между соседними моделями в таблице. Значимо они отличаются только от явных отстающих, вроде Llama 3.3 70B. То есть нынешний рейтинг — это точечные оценки, не строгое ранжирование.
Покрытие ATT&CK узкое: 3 тактики из 14 (доступ, закрепление, привилегии), без бокового перемещения, эксфильтрации, Active Directory и облаков — честно признанное самими авторами ограничение.
И момент, который авторы не назвали риском: судья в K-Benchmark — тот же Claude Sonnet 4.5, который заодно сидит в таблице как тестируемый агент (73,53%). Модель частично оценивает саму себя, и нет гарантии, что она не снисходительнее к своему стилю рассуждений. В ограничениях это не обсуждается — хотя ровно об этом риске говорит их же случай, когда оценщик решил задачу за испытуемого.
Как фреймворк — методология переживёт смену моделей: разделение планирования и исполнения, привязка к ATT&CK и проверенный экспертами судья — это здравые решения. А вот конкретные цифры — снимок с коротким сроком жизни: контаминация датасета, слабая статистика и судья-в-доле снизят значимость быстрее, чем хотелось бы. У авторов есть план расширения — больше тактик, AD-окружения, повторные прогоны. Если реализуют — инструмент останется живым.
@gostev_future
- 👍 5
- 🔥 2












