Почему мы не нашли готового PII-детектора для русского языка — https://clck.ru/3VLwwU
PII-детекцию часто представляют как понятную задачу: взяли regex, добавили NER, подключили модель — и персональные данные больше не уходят в LLM.
Но в реальном русском трафике всё быстро ломается: падежи, кириллица, ИНН, СНИЛС, паспорта, внутренние идентификаторы и контекст, без которого цифры ничего не значат.
В новой статье от нашего CTO, Андрея Непряхина, разбираем, как мы строили боевой контур перед LLM: от первых готовых решений до собственной архитектуры с несколькими слоями детекции, маскированием и проверками.
Обсуждаем:
• почему готового PII-детектора оказалось недостаточно;
• где спотыкаются regex, NER и zero-shot модели;
• зачем понадобились GLiNER и дополнительные адаптеры;
• почему обратимое маскирование сложнее, чем кажется;
• какие ошибки проявляются только на реальном трафике
Post #2768
270
