CyberPal 2.0: Семейство SLM, которые смогли
В октябре IBM зарелизили интересную работу https://arxiv.org/abs/2510.14113 по специализированным малым моделям (SLM) для кибербеза — CyberPal 2.0 (от 4B до 20B параметров).
Самое важное здесь — не сама архитектура (в базе лежат Qwen-3 и gpt-oss), а инжиниринг данных и пайплайн подготовки датасета SecKnowledge 2.0. Они показали, как за счет качественного синтетического CoT (Chain-of-Thought) и граундинга (grounding) можно выжать из SLM перформанс уровня больших языковых моделей.
Новый датасет: SecKnowledge 2.0
Главная проблема security-LLM — галлюцинации и поверхностные знания. IBM решили это не просто файнтюнингом на текстах, а сложным пайплайном обогащения данных.
Expert-in-the-loop Schema: Эксперты задают жесткие форматы вывода (Reasoning Traces) для конкретных тасков (всего 105 типов задач). Это не просто "ответь на вопрос", а пошаговые инструкции: "выдели IoC → сопоставь с TTPs → предложи митигацию".
RAG-driven Synthetic Generation: Чтобы синтетика не галлюцинировала, они встроили поиск в процесс генерации датасета (а не только на инференсе):
- Query Building: первая LLM генерит поисковые запросы на основе сырой инструкции.
- Filtering: вторая LLM отбирает только те запросы, которые реально закроют пробелы в знаниях.
- Retrieval: забирают инфу из веба или векторных баз.
- Re-writing: backbone-модель (gpt-oss-120b) переписывает ответ, используя найденные доказательства и соблюдая экспертную схему.
Итог: Датасет, где каждый шаг рассуждения (CoT) подкреплен ретривом, а не весами модели-учителя.
Дополнительная деталь: в итоговых данных для обучения, помимо датасета выше, 25% итоговой доли составили короткие ответы из оригинального SecKnowledge, не требующие длинных рассуждений.
Training Recipe: Base vs Post-Trained
Главный инсайт: Файнтюн базовой модели (Base) работает лучше, чем дообучение уже инструктивной (Instruct/Chat) версии.
- При старте с Qwen3-8B-Base прирост на бенчмарках составил ~15%.
- При старте с Qwen3-8B-Instruct прирост всего ~5%.
- На сложных задачах (Root Cause Mapping) разница колоссальная: +22.7% (Base) против +1.85% (Instruct).
Авторы говорят, что инструктивные модели уже "зажаты" своим RLHF/SFT, и переучивать их под специфичный доменный формат сложнее, чем накатывать знания на "чистый лист" (base).
Бенчмарки
CTI-RCM (Root Cause Mapping): Задача — связать CVE, баг-репорты и тикеты с CWE. Здесь нужно глубокое понимание, а не просто поиск по ключевым словам.
- CyberPal-20B занял 1-е место, обогнав GPT-4o, o1, o3-mini и Sec-Gemini v1.
- Даже мелкая CyberPal-4B заняла второе место.
CTI-MCQ: На тестах по Threat Intel (атакующие группы, тактики) модели дышат в спину Sec-Gemini.
Квантование
Для on-prem деплоя (что критично для SOC, где нельзя лить логи в облако):
- 8-bit: падение качества < 1%.
- 4-bit: падение 2-4%, но модель все еще значительно лучше базовых и конкурентов. 20B в 4 битах помещается на одну недорогую карту для быстрого инференса.
Выводы
1) Статья подтверждает тренд: Data Curation > Model Scale.
2) Если вы делаете своего security-агента:
- Не берите просто сырые репорты. Прогоните их через пайплайн генерации вопросов-ответов с валидацией через поиск.
- Дообучайте Base-версии моделей.
- Структурируйте CoT. Модель должна учиться "думать" по шаблону аналитика, а не просто генерировать текст.
#llm #cybersecurity
Post #67
693

- 🔥 7
- 🤝 2
- 👍 1