В MaliciousSkillBench авторы собрали единый бенчмарк на основе 13 публичных источников для проверки безопасности скиллов. На нем они сравнили несколько существующих сканеров, а также обучили и проверили собственные текстовые классификаторы.
После объединения в бенчмарке осталось 9740 скиллов: 7505 вредоносных и 2235 безопасных. Их разделили случайно: по группам похожих скиллов и по источникам. При этом и классификаторы, и готовые сканеры анализировали только текст
SKILL.md — без остальных файлов.Существующие сканеры тестировали офлайн, без LLM-анализа. В таких конфигурациях они не нашли удачного баланса: снижение ложных срабатываний сопровождалось резким падением числа найденных вредоносных скиллов.
Лучший же текстовый классификатор авторов (Word TF-IDF + SVM) получил Macro-F1 0,932 на тесте при случайном разбиении и 0,665 — на источниках, не встречавшихся при обучении. На новых источниках он нашел 95,6% вредоносных скиллов, но ошибочно заблокировал 62,4% безопасных.
Такой подход мне кажется интересным, но на практике:
▸ Текстовый классификатор может быть одним из этапов проверок, но с FPR 62,4% в проде тебя съедят коллеги :)
▸ Анализа одного
SKILL.md недостаточно: он может не содержать признаков атаки, а вся вредоносная нагрузка — находиться в других файлах скилла▸ Поэтому совсем без LLM-анализа пока, кажется, не обойтись
Препринт MaliciousSkillBench
Датасет на Hugging Face
GitHub
