TGViewer
AGIMA.News AGIMA.News @agima_ru · 698 subscribers
Post #2768 270
Почему мы не нашли готового PII-детектора для русского языка — https://clck.ru/3VLwwU

PII-детекцию часто представляют как понятную задачу: взяли regex, добавили NER, подключили модель — и персональные данные больше не уходят в LLM.

Но в реальном русском трафике всё быстро ломается: падежи, кириллица, ИНН, СНИЛС, паспорта, внутренние идентификаторы и контекст, без которого цифры ничего не значат.

В новой статье от нашего CTO, Андрея Непряхина, разбираем, как мы строили боевой контур перед LLM: от первых готовых решений до собственной архитектуры с несколькими слоями детекции, маскированием и проверками.

Обсуждаем:
• почему готового PII-детектора оказалось недостаточно;
• где спотыкаются regex, NER и zero-shot модели;
• зачем понадобились GLiNER и дополнительные адаптеры;
• почему обратимое маскирование сложнее, чем кажется;
• какие ошибки проявляются только на реальном трафике
More from @agima_ru
  1. Sep 22, 2026Как создать карьерный сайт, который привлекает кандидатов: опыт AGIMA Мы в AGIMA разрабаты…
  2. Sep 18, 2026🚀 Будущее цифровых продуктов: новыми сайтами управляют ИИ-агенты 22 сентября в Москве про…
  3. Sep 17, 2026Хакатон AGIMA: от брифа до решения за один день 24 сентября проведём офлайн-хакатон, где 6…
  4. Sep 15, 2026SOLID в реальном мире. ISP без микроинтерфейсов - https://clck.ru/3VqJ5G Принцип разделени…
  5. Sep 10, 202616 сентября в 15:00 мск — Большой Созвон от Partners’ Club В этом году тема, которую уже н…
  6. Sep 9, 2026Как превратить ИИ из модного эксперимента в работающий инженерный инструмент? 10 сентября…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →