Скомпрометированные секрете — одна из главных угроз в кибербезопасности, участвует аж в 31% утечек. Традиционные методы обнаружения, основанные на регулярных выражениях, страдают от недостаточного понимания контекста, высокого уровня ложных срабатываний и трудоемкого обслуживания, охватывая лишь около 60% потенциальных утечек.
Команда Wiz отказалась от использования крупных моделей (GPT, Claude Sonnet) из-за их высокой нагрузки на ресурсы, стоимости и рисков конфиденциальности. Вместо этого была дообучена компактная модель Llama 3.2 1B, оптимизированная для одной задачи — поиска секретов.
Это позволило достичь 86% точности и 82% полноты, что превосходит регекс-подходы, при этом модель работает на стандартном CPU-оборудовании.
По этому поводу есть статья, которая детализирует все этапы: подготовку набора данных с помощью LLM для ускорения разметки (заменив месяцы ручной работы на дни), обучение модели и тестирование.
Результаты показали значительное снижение ложных срабатываний по сравнению с традиционными методами.
Разработанная модель интегрирована в продукт Wiz Data Security для быстрой и точной защиты данных. В будущем планируется расширение охвата (конфигурационные файлы, документация), оптимизация размера модели, улучшение скорости вывода через квантование и развитие контекстного анализа для оценки критичности секретов.
Исследование подтверждает, что небольшие дообученные модели могут эффективно решать специфические задачи кибербезопасности, балансируя производительность, эффективность и конфиденциальность, а использование LLM для подготовки данных ускоряет инновации в этой области.
Это к вопросу о том, как на практике помогают LLM 🫡
@DevOpsKaz 😛
