TGViewer
Одержимый кодом🔥 Одержимый кодом🔥 @cutcode · 343 subscribers
Post #116 796
Сегодня быстренько протестировал OpenAI Privacy Filter для поиска и редактирования PII.

Если коротко: это локальный open-weight фильтр для персональных данных. Он находит в тексте имена, телефоны, email, адреса, даты, номер счета, секреты и возвращает spans с byte offsets, после чего текст можно безопасно редактировать перед отправкой в LLM.

Хорошая новость: модель достаточно лёгкая по меркам локальных ML-инструментов. Checkpoint скачивается примерно на 2.8 GB, запускал через Docker на CPU. Это не LLM на десятки гигабайт, а специализированный PII-фильтр, который можно встроить перед прокси/LLM API.

Базовый пример работает нормально:


{
"detected_spans": [
{
"label": "private_person",
"text": "Иван Иванов"
},
{
"label": "private_phone",
"text": "79222222222"
}
],
"redacted_text": "Привет меня зовут <PRIVATE_PERSON> мой номер <PRIVATE_PHONE>"
}


Но на русском языке быстро проявляются те же проблемы, что и у аналогов. Без дополнительного fine-tuning на русскоязычных датасетах я бы не стал использовать это в production как единственный слой защиты.

Например, обычные слова с заглавной буквы модель может принять за имя:


{
"text": "Привет - это Нормальное Слово",
"detected_spans": [
{
"label": "private_person",
"text": "Нормальное Слово"
}
],
"redacted_text": "Привет - это <PRIVATE_PERSON>"
}


Ещё один нюанс: телефонный номер иногда классифицируется не как private_phone, а как account_number:


{
"by_label": {
"account_number": 1,
"private_person": 2,
"private_phone": 1
},
"redacted_text": "Привет меня зовут <PRIVATE_PERSON> мой номер <ACCOUNT_NUMBER>! А меня зовут <PRIVATE_PERSON> и телефон - <PRIVATE_PHONE>"
}


По ресурсам в Docker на CPU получил такие срезы:

CPU RAM
1834.93% 3.838 GiB / 7.648 GiB
2348.13% 4.114 GiB / 7.648 GiB
2272.03% 3.279 GiB / 7.648 GiB

То есть примерно 18-23 логических CPU в пике и около 3.3-4.1 GiB RAM. Потоков внутри контейнера было около 55.

Вывод: штука рабочая и полезная как локальный PII pre-filter перед LLM, особенно если нужен контроль над данными до отправки наружу. Но для русского языка нужно либо дообучение, либо дополнительный слой правил/валидации, иначе будут false positives и нестабильная классификация категорий.
GitHub GitHub - openai/privacy-filter: OpenAI Privacy Filter OpenAI Privacy Filter. Contribute to openai/privacy-filter development by creating an account on GitHub.
  • 👍 8
  • ❤ 3
  • 🔥 3
More from @cutcode
  1. Sep 22, 2026Post #131
  2. Sep 11, 2026Но все еще скидка 15% по промокоду CUTCODE-26!
  3. Sep 11, 2026Пыхник’26 — 2 октября расскажу про осознанное использование AI. Скидка 15% по промокоду CU…
  4. Sep 11, 2026Теперь документация по Laravel пишется для ИИ-агентов. И скорей всего ИИ-агентами 😁
  5. Sep 11, 2026Топ-1 преимуществом Laravel всегда была документация. Теперь она будет для агентов. Помяне…
  6. Sep 9, 2026Пыхник’26 — целая неделя PHP! С 28 сентября по 2 октября пройдёт Пыхник’26 — онлайн-конфер…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →