TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #822 200
🧨 Дообучение LLM кибербезопасности может сделать ответы модели хуже

Есть очевидная идея взять небольшую модель с открытыми весами, дообучить её на security-данных и получить собственного специалиста по кибербезопасности. Однако этот подход стоит применять осторожно.

Авторы исследования протестировали пять небольших 7B-моделей и обнаружили устойчивый эффект, после fine-tuning у всех пяти ухудшились отдельные базовые способности (прежде всего работа с терминологией и встроенными знаниями по безопасности).

⚙️ Проблема не всегда там, где вы её ищете

Авторы предлагают сначала диагностировать модель с помощью framework FiT (Fine-tuning Impact Test).

Он разделяет способности модели на три независимых слоя:

🔹 Vocabulary: понимает ли модель security-термины и их значения;

🔹 Knowledge: действительно ли она знает предметную область;

🔹 Contextualization: умеет ли использовать внешний контекст, например документы из RAG, для решения задачи.

🧠 Неожиданный эффект

В экспериментах fine-tuning иногда резко ухудшал результаты на вопросах, где модель должна была отвечать без внешней информации.

У одной из протестированных моделей accuracy на knowledge-задачах упала с 0,71 до 0,08. На другой с 0,72 до 0,12. На первый взгляд кажется, что модель просто «забыла» знания, но затем исследователи подключили RAG и картина изменилась. Когда необходимые сведения передавались модели непосредственно в контексте, качество оставалось высоким.

То есть fine-tuning не обязательно уничтожил знания. Он мог изменить поведение модели при отсутствии внешнего контекста.

📉 Другие изменения

После разных режимов fine-tuning менялся даже рейтинг моделей. Для одного типа дообучения относительный порядок моделей в основном сохранялся. Для другого практически перевернулся.

Получается интересный инженерный сценарий, модель, которая до fine-tuning была лучшим кандидатом для security-задач, после обучения может стать провальным выбором.

🛡️ RAG или Fine-tuning?

Главный практический вывод исследования - не бросаться в fine-tuning только потому, что модель плохо отвечает на security-вопросы.

Если проблема заключается в отсутствии актуальных CVE, внутренних документов, threat intelligence или другой постоянно меняющейся информации, RAG может оказаться более подходящим решением.

🔗 Исследование: https://arxiv.org/abs/2607.18725

🔗 Код: https://github.com/shaswata09/FiT

Stay secure and read SecureTechTalks 📚

#кибербезопасность #AI #LLM #RAG #FineTuning #AISecurity #ThreatIntelligence #CyberSecurity #AppSec #SecureTechTalks
  • 👍 1
More from @securetechtalks
  1. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  2. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
  3. Sep 29, 2026🍷 Исследователи «напоили» LLM Команда UNSW решила проверить довольно странную гипотезу, ч…
  4. Sep 28, 2026🧨 GitHub отдал fuzzing AI агенту GitHub Security Lab открыла инструмент, который автомати…
  5. Sep 25, 2026🧨 Carbonato: ботнет устанавливает AI агента на взломанный сервер Исследователи ThreatDown…
  6. Sep 24, 2026🧨 CLOSEDQUORUM: вредоносное ПО передало управление атакой совету из четырёх LLM Cisco Tal…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →