🧨 Дообучение LLM кибербезопасности может сделать ответы модели хуже
Есть очевидная идея взять небольшую модель с открытыми весами, дообучить её на security-данных и получить собственного специалиста по кибербезопасности. Однако этот подход стоит применять осторожно.
Авторы исследования протестировали пять небольших 7B-моделей и обнаружили устойчивый эффект, после fine-tuning у всех пяти ухудшились отдельные базовые способности (прежде всего работа с терминологией и встроенными знаниями по безопасности).
⚙️ Проблема не всегда там, где вы её ищете
Авторы предлагают сначала диагностировать модель с помощью framework FiT (Fine-tuning Impact Test).
Он разделяет способности модели на три независимых слоя:
🔹 Vocabulary: понимает ли модель security-термины и их значения;
🔹 Knowledge: действительно ли она знает предметную область;
🔹 Contextualization: умеет ли использовать внешний контекст, например документы из RAG, для решения задачи.
🧠 Неожиданный эффект
В экспериментах fine-tuning иногда резко ухудшал результаты на вопросах, где модель должна была отвечать без внешней информации.
У одной из протестированных моделей accuracy на knowledge-задачах упала с 0,71 до 0,08. На другой с 0,72 до 0,12. На первый взгляд кажется, что модель просто «забыла» знания, но затем исследователи подключили RAG и картина изменилась. Когда необходимые сведения передавались модели непосредственно в контексте, качество оставалось высоким.
То есть fine-tuning не обязательно уничтожил знания. Он мог изменить поведение модели при отсутствии внешнего контекста.
📉 Другие изменения
После разных режимов fine-tuning менялся даже рейтинг моделей. Для одного типа дообучения относительный порядок моделей в основном сохранялся. Для другого практически перевернулся.
Получается интересный инженерный сценарий, модель, которая до fine-tuning была лучшим кандидатом для security-задач, после обучения может стать провальным выбором.
🛡️ RAG или Fine-tuning?
Главный практический вывод исследования - не бросаться в fine-tuning только потому, что модель плохо отвечает на security-вопросы.
Если проблема заключается в отсутствии актуальных CVE, внутренних документов, threat intelligence или другой постоянно меняющейся информации, RAG может оказаться более подходящим решением.
🔗 Исследование: https://arxiv.org/abs/2607.18725
🔗 Код: https://github.com/shaswata09/FiT
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #RAG #FineTuning #AISecurity #ThreatIntelligence #CyberSecurity #AppSec #SecureTechTalks
Post #822
200

- 👍 1