OpenAI выложили на Hugging Face модель для детекции персональных данных — https://huggingface.co/openai/privacy-filter.
Лицензия Apache 2.0, то есть можно встраивать в коммерческие продукты без оговорок.
Это не генеративная модель, а классификатор: на вход текст, на выход — разметка токенов по 8 категориям (имя, адрес, email, телефон, дата, URL, номер счёта, секреты вроде API-ключей и паролей). Размер — всего 1.5B параметров. Крутится на ноутбуке, контекстное окно 128 000 токенов.
Зачем это юристу. Стандартная история: надо прогнать массив документов через LLM, а отправлять в облако нельзя — 152-ФЗ, NDA, просто здравый смысл. Такой фильтр встаёт перед облачной моделью: локально размечает данные, подменяет на плейсхолдеры, обезличенный текст уходит в условный Claude или GPT, обратная подстановка опять локально. По смыслу это техническое средство обезличивания, близкое по духу к требованиям Приказа РКН № 140, хотя называть результат «обезличенными данными» в юридическом смысле на основании одной модели точно не стоит — это просто инструмент минимизации рисков.
Где подвох. Модель обучалась преимущественно на английском. На русском качество просядет — OpenAI сами пишут про падение на non-Latin scripts.
А что с русскими аналогами? Прямого аналога такого же класса — компактный готовый PII-детектор с permissive-лицензией — я под русский не знаю.
Что есть:
— Natasha / Slovnet / Yargy (MIT). NER для русского с категориями PER/LOC/ORG плюс отдельные экстракторы для дат, денег, адресов. Компактный, CPU, production-grade для новостных текстов. Но это классический NER, а не PII-детектор: номера счетов, карт, секреты, ключи он не ловит — это надо дописывать регулярками или через Yargy-правила.
— DeepPavlov RuBERT NER (Apache 2.0) — тяжелее, лучше качество на русском, но 2 ГБ модель и GPU на инференсе. Снова не PII, а обычные сущности.
— Microsoft Presidio (MIT) — фреймворк, в который можно подключить Natasha в качестве NER-движка и добавить паттерны под СНИЛС, ИНН, паспорт, номера карт. На практике живая боевая сборка под российский контур собирается именно так.
— Piiranha (iiiorg) — мультиязычная PII-модель на базе mdeberta, заявлена в том числе для русского. Но лицензия CC-BY-NC-ND: ни коммерческого использования, ни производных работ. Для юрфирмы и корпоративного продукта не годится.
Вывод по сегодняшнему ландшафту: если нужна локальная детекция ПДн в русскоязычных документах, до готовой коробки дело пока не дошло — собирается вручную из Presidio + Natasha/DeepPavlov + самописных правил под российские идентификаторы. Или делается "файнтюн" того же privacy-filter на собственном размеченном корпусе. Второй путь в теории интереснее, если есть датасет.