TGViewer
Гостев из будущего Гостев из будущего @gostev_future · 1.41K subscribers
Post #358 1.3K
1244-1-3373-1-10-20260615.pdf635.3 KB
Эксперты Сбера и Касперского опубликовали в журнале МГУ «Современные информационные технологии и ИТ-образование» любопытную статью.

Авторы предложили двумерный бенчмарк для LLM (БЯМ) в пентесте: отдельно замерять планирование атаки и её исполнение. Раньше эти навыки смешивали в одну метрику, и было непонятно, где именно проигрывает модель — в голове или в руках.

Протестировано 11 моделей. В планировании лидер — Claude Sonnet 4.5 (78,22%), за ним GPT-5 (73,72%) и Gemini 2.5 Pro (72,16%); хуже всех — Gemini 2.5 Flash (37,66%). В исполнении первые — GPT-5 и Qwen3 Max (по 76,47%), рядом GLM 4.6 и Sonnet 4.5 (73,53%); хуже всех — Llama 3.3 70B (5,88%, в основном из-за провалов в синтаксисе вызова инструментов).

Зафиксированные сбои: галлюцинации (выдуманные IP и флаги решений), уход от задачи (агент DeepSeek бросил повышение привилегий ради решения квадратного уравнения), потеря контекста в длинных сценариях, и курьёз — агент-оценщик сам выполнил задание вместо проверки; авторы это поймали и поправили промпт.

Из списка моделей видно: пока статья готовилась, модели ушли на 1–3 поколения вперёд. Но цель была не зафиксировать сегодняшние цифры, а собрать бенчмарк, применимый и в будущем — датасет и код обещают выложить на GitVerse в открытом доступе.

Тут у меня есть замечания.

CSL-Benchmark собран из 846 шагов 44 отчётов с платформ вроде HackTheBox — открытых и индексируемых. Риск: будущие модели уже видели эти разборы в обучении или просто найдут их поиском. Этот риск авторы вообще не упоминают в ограничениях — а это первое, что убьёт чувствительность бенчмарка: рост баллов будет значить не «модель стала умнее», а «модель выучила ответы».

K-Benchmark прогонялся по одному разу на задачу — доверительные интервалы широкие, точный тест Фишера не находит значимой разницы между соседними моделями в таблице. Значимо они отличаются только от явных отстающих, вроде Llama 3.3 70B. То есть нынешний рейтинг — это точечные оценки, не строгое ранжирование.

Покрытие ATT&CK узкое: 3 тактики из 14 (доступ, закрепление, привилегии), без бокового перемещения, эксфильтрации, Active Directory и облаков — честно признанное самими авторами ограничение.

И момент, который авторы не назвали риском: судья в K-Benchmark — тот же Claude Sonnet 4.5, который заодно сидит в таблице как тестируемый агент (73,53%). Модель частично оценивает саму себя, и нет гарантии, что она не снисходительнее к своему стилю рассуждений. В ограничениях это не обсуждается — хотя ровно об этом риске говорит их же случай, когда оценщик решил задачу за испытуемого.

Как фреймворк — методология переживёт смену моделей: разделение планирования и исполнения, привязка к ATT&CK и проверенный экспертами судья — это здравые решения. А вот конкретные цифры — снимок с коротким сроком жизни: контаминация датасета, слабая статистика и судья-в-доле снизят значимость быстрее, чем хотелось бы. У авторов есть план расширения — больше тактик, AD-окружения, повторные прогоны. Если реализуют — инструмент останется живым.

@gostev_future
  • 👍 5
  • 🔥 2
More from @gostev_future
  1. Sep 23, 2026На прошлой неделе обнаружилась биолаборатория Anthropic, на этой неделе у лаборатории уже…
  2. Sep 22, 2026Помните исследование о том, как ИИ играет в Civilization? А вот мой однофамилец Питер Гост…
  3. Sep 20, 2026Я уже писал о недавнем аресте австралийца Рубена Томсона из TeamPCP, который, при всех сво…
  4. Sep 20, 2026У президента с высочайшим IQ есть любимое занятие — что-нибудь переименовать. Мексиканский…
  5. Sep 19, 2026Сегодня в России проходят выборы, и в этой связи для цикла «Гостев из прошлого» у меня тож…
  6. Sep 18, 2026На этой неделе много обсуждали, как руководители крупнейших американских ИИ-лабораторий вд…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →