TGViewer
False Positive False Positive @falseposi · 1.13K subscribers
Post #40 651
Что мы поняли о роли AI/ML в защите данных за последний год?

Сегодня, на Positive Security Day состоится долгожданный коммерческий релиз PT Data Security — продукта для защиты корпоративных данных, независимо от их типа и места хранения.
Наша команда разрабатывала одну из ключевых фич - ML-модуль классификации данных. Прошли путь с нуля — от идеи и конкурентного анализа до интеграции в продукт и оптимизации инференса.

Поэтому делимся нашим взглядом на роль AI/ML в классификации данных:

⚡️1. Метаданные ≠ данные

Мы провели конкурентный анализ и поняли, что большинство решений на рынке анализируют только метаданные — названия файлов/колонок/таблиц, расширения и описания к объектам.
Но в реальных компаниях данные часто выглядит так: “новый документ финал.docx” или "column123"

Так что “аналитика по названиям” быстро разбивается о реальность корпоративного хаоса.

⚡️2. Реальность рушит простые гипотезы

Мы собрали валидационную выборку, имитирующую корпоративные данные, и прогнали по ней несколько вендоров и open-source решений.
Результат: полнота <= 40% у regex-пайплайнов.
Регулярки просто не видят такие сущности, как имена, организации, телефоны, даты и многие другие — особенно в естественном тексте.

⚡️3. Значит, идем глубже — в контент

С первых итераций мы сделали ставку на анализ содержимого.
Для прототипов использовали Microsoft Presidio — удобный фреймворк, который позволил без интеграции в продукт опробовать наши ML-модели на сценарии защиты данных (но производительность фреймворка не позволяет использовать его в production).

Мы попробовали несколько ML подходов, остановившись на NER архитектуре. С учетом специфики РФ рынка, держали фокус на работе как с русским, так и с английским языком.
Подробности — в нашей статье на Хабре.

⚡️4. Идеальный баланс: ML + регулярки

Наш ML классифицирует только те сущности, для которых нет четких правил.
А регулярки, прошедшие жесткий отбор, дополняют модель.
Так мы собрали гибридную систему, которая сочетает точность правил и гибкость ML. Продукт позволяет объединять результаты работы обоих подходов в композитные правила для гибкой настройки.

⚡️5. А LLM?

Многие компании рассматривают применение LLM для решения той же задачи. Но когда у клиента миллионы файлов и тысячи таблиц, большие модели оказываются слишком прожорливыми и медлительными.

LLM имеют потенциал в качестве копайлотов для ИБ-специалиста, но не станут ядром системы, которая должна работать на масштабе и в реальном времени.

---

Поздравляем команду продукта в релизом и уходим готовить новые фичи, которые позволят еще надежнее защитить компании от утечек!


____________________________________

Вадим Безбородов, ML-инженер AppSec
Максим Митрофанов, ML-лид AppSec
  • 🔥 9
  • 👍 2
More from @falseposi
  1. Sep 25, 2026False Positive pinned a photo
  2. Sep 25, 2026Никто: Абсолютно никто: ИИ-агент, увидев PowerShell на сервере: 🚨🚨🚨 ВЗЛОМ 🚨 ВСЁ ПРОПАЛ…
  3. Sep 24, 2026Попробовать атакующих агентов кстати сейчас самим можно и в лабах и на CTF. А как повторит…
  4. Sep 24, 2026Выкладываем запись RG Глеба Кумичева про то как агенты хакнули HF #reading_group #openai #…
  5. Sep 18, 2026Мы начинаем🤗
  6. Sep 17, 2026Всем привет! В эту пятницу попробуем разобраться что из себя представляет автономный агент…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →