TGViewer
Дамасские чернила | AI и M&A Дамасские чернила | AI и M&A @forgednotwritten · 1.68K subscribers
Post #176 960
⚡ Новое слово в обезличивании ПДн для английского языка

OpenAI выложили на Hugging Face модель для детекции персональных данных — https://huggingface.co/openai/privacy-filter.
Лицензия Apache 2.0, то есть можно встраивать в коммерческие продукты без оговорок.

Это не генеративная модель, а классификатор: на вход текст, на выход — разметка токенов по 8 категориям (имя, адрес, email, телефон, дата, URL, номер счёта, секреты вроде API-ключей и паролей). Размер — всего 1.5B параметров. Крутится на ноутбуке, контекстное окно 128 000 токенов.

Зачем это юристу. Стандартная история: надо прогнать массив документов через LLM, а отправлять в облако нельзя — 152-ФЗ, NDA, просто здравый смысл. Такой фильтр встаёт перед облачной моделью: локально размечает данные, подменяет на плейсхолдеры, обезличенный текст уходит в условный Claude или GPT, обратная подстановка опять локально. По смыслу это техническое средство обезличивания, близкое по духу к требованиям Приказа РКН № 140, хотя называть результат «обезличенными данными» в юридическом смысле на основании одной модели точно не стоит — это просто инструмент минимизации рисков.

Где подвох. Модель обучалась преимущественно на английском. На русском качество просядет — OpenAI сами пишут про падение на non-Latin scripts.

А что с русскими аналогами? Прямого аналога такого же класса — компактный готовый PII-детектор с permissive-лицензией — я под русский не знаю.

Что есть:
— Natasha / Slovnet / Yargy (MIT). NER для русского с категориями PER/LOC/ORG плюс отдельные экстракторы для дат, денег, адресов. Компактный, CPU, production-grade для новостных текстов. Но это классический NER, а не PII-детектор: номера счетов, карт, секреты, ключи он не ловит — это надо дописывать регулярками или через Yargy-правила.
— DeepPavlov RuBERT NER (Apache 2.0) — тяжелее, лучше качество на русском, но 2 ГБ модель и GPU на инференсе. Снова не PII, а обычные сущности.
— Microsoft Presidio (MIT) — фреймворк, в который можно подключить Natasha в качестве NER-движка и добавить паттерны под СНИЛС, ИНН, паспорт, номера карт. На практике живая боевая сборка под российский контур собирается именно так.
— Piiranha (iiiorg) — мультиязычная PII-модель на базе mdeberta, заявлена в том числе для русского. Но лицензия CC-BY-NC-ND: ни коммерческого использования, ни производных работ. Для юрфирмы и корпоративного продукта не годится.


Вывод по сегодняшнему ландшафту: если нужна локальная детекция ПДн в русскоязычных документах, до готовой коробки дело пока не дошло — собирается вручную из Presidio + Natasha/DeepPavlov + самописных правил под российские идентификаторы. Или делается "файнтюн" того же privacy-filter на собственном размеченном корпусе. Второй путь в теории интереснее, если есть датасет.
huggingface.co openai/privacy-filter · Hugging Face We’re on a journey to advance and democratize artificial intelligence through open source and open science.
  • 👍 5
  • 🔥 5
  • 🦄 1
More from @forgednotwritten
  1. Sep 26, 2026👁 Как ИИ повлиял на моё профессиональное самоощущение? Очень классно провели с Юлией Миха…
  2. Sep 24, 2026🐈‍⬛ Сравнительно-правовое цивилистическое исследование об ИИ в праве 23 сентября вышло хо…
  3. Sep 24, 202625 сентября выступаю в Клубе корпоративных споров Юлии Михальчук Ваша покорная рада подели…
  4. Sep 19, 2026Встречайте Уробороса: личный ИИ-ассистент нового поколения, переписывающий собственный код…
  5. Sep 18, 2026Astra for Law: что запуск OpenAI меняет для российского рынка 17 сентября OpenAI объявила…
  6. Sep 17, 2026Вайбкодинг, будущее юриста и запрос на "потрогать траву" Я уже больше года непрерывно вайб…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →