Если коротко: это локальный open-weight фильтр для персональных данных. Он находит в тексте имена, телефоны, email, адреса, даты, номер счета, секреты и возвращает spans с byte offsets, после чего текст можно безопасно редактировать перед отправкой в LLM.
Хорошая новость: модель достаточно лёгкая по меркам локальных ML-инструментов. Checkpoint скачивается примерно на 2.8 GB, запускал через Docker на CPU. Это не LLM на десятки гигабайт, а специализированный PII-фильтр, который можно встроить перед прокси/LLM API.
Базовый пример работает нормально:
{
"detected_spans": [
{
"label": "private_person",
"text": "Иван Иванов"
},
{
"label": "private_phone",
"text": "79222222222"
}
],
"redacted_text": "Привет меня зовут <PRIVATE_PERSON> мой номер <PRIVATE_PHONE>"
}
Но на русском языке быстро проявляются те же проблемы, что и у аналогов. Без дополнительного fine-tuning на русскоязычных датасетах я бы не стал использовать это в production как единственный слой защиты.
Например, обычные слова с заглавной буквы модель может принять за имя:
{
"text": "Привет - это Нормальное Слово",
"detected_spans": [
{
"label": "private_person",
"text": "Нормальное Слово"
}
],
"redacted_text": "Привет - это <PRIVATE_PERSON>"
}
Ещё один нюанс: телефонный номер иногда классифицируется не как private_phone, а как account_number:
{
"by_label": {
"account_number": 1,
"private_person": 2,
"private_phone": 1
},
"redacted_text": "Привет меня зовут <PRIVATE_PERSON> мой номер <ACCOUNT_NUMBER>! А меня зовут <PRIVATE_PERSON> и телефон - <PRIVATE_PHONE>"
}
По ресурсам в Docker на CPU получил такие срезы:
CPU RAM
1834.93% 3.838 GiB / 7.648 GiB
2348.13% 4.114 GiB / 7.648 GiB
2272.03% 3.279 GiB / 7.648 GiB
То есть примерно 18-23 логических CPU в пике и около 3.3-4.1 GiB RAM. Потоков внутри контейнера было около 55.
Вывод: штука рабочая и полезная как локальный PII pre-filter перед LLM, особенно если нужен контроль над данными до отправки наружу. Но для русского языка нужно либо дообучение, либо дополнительный слой правил/валидации, иначе будут false positives и нестабильная классификация категорий.