TGViewer
Поляков считает: AI, код и кейсы Поляков считает: AI, код и кейсы @countwithsasha · 6.93K subscribers
Post #703 3.29K
Анонимизация данных для ИИ: почему «настрой фильтр за пять минут» не спасёт

Тут мне присылают видео, где блогер бодро объясняет: подключить защиту персональных данных к любимому ИИ-агенту — дело пары кликов. Посмотришь — и кажется, будто утечки закончились навсегда.

🔗 Вот эту модель рекомендовал блогер на видео: ссылка

Разбираю, почему на проде так не работает.

🚧 Откуда вообще проблема

У любого бизнеса — от стартапа до корпорации — есть обязанность защищать персональные данные сотрудников и клиентов. За утечку — штраф, а в договорах часто прямо прописано: «Исполнитель обязуется не передавать данные третьим лицам».

С одной стороны — ИИ, который ускоряет работу. С другой — безопасники, которые запрещают им пользоваться: запросы уходят в чужие юрисдикции и компании, а туда эти данные слать нельзя. За помощью обычно зовут инженеров.

😐 «Ну поставьте локальную модель»

Идеальный вариант — развернуть свою модель уровня Kimi K2.6 и гонять всю корпоративную работу через неё. Данные не покидают контур, анонимизация не нужна вообще. Одна беда: под такую модель нужны сотни гигабайт, а лучше терабайт видеопамяти. Мало у кого столько есть.

Вот тут и появляется анонимизация — как компромисс.

Поэтому фильтр должен быть маленьким и быстрым — он стоит на входе у каждого запроса. Ровно за этим OpenAI и выпустила privacy-filter: 1,5 млрд параметров, активны только 50 млн, крутится даже на CPU, без видеокарты. Кстати, именно эту модель и советовал блогер.

🧩 Как устроена анонимизация

Любая — это три задачи:

1. Найти в тексте всё чувствительное и определить тип: имя, телефон, счёт, адрес.

2. Модифицировать запрос к LLM так, чтобы модель могла понимать задачу с сохранением тегов, допустим заменить все перс данные на <PII type="name" id="1">

🚀 Такая модификация позволяет сохранить интент вопроса, допустим явно объявить LLM, что она действует в интересах person_2. А также явно укажет, сколько всего есть акторов и какие у них есть идентификационные свойства.


3 .Получить ответ от облачной модели и подставить реальные данные обратно вместо меток. Склонения иногда хромают, но это не критично.

⚠️ Где всё сыпется

Тут и вылезает разрыв между красивой презентацией и продом.

• На бенчмарке OpenAI заявляет 98% полноты. На моих реальных договорах фильтр из коробки оставляет до 30% персональных данных неразмеченными.

• Модель путает категории. Для телефона и номера счёта это не страшно. А вот если адрес уезжает в категорию «человек» — контекст для LLM становится шумным, растёт риск галлюцинаций.

• Простой фильтр без идентификаторов не различает людей — все имена схлопываются в одну метку. Договор на три стороны превращается в кашу: кто кому что должен, модель уже не понимает.

⚡ Планируйте фильтр как слой защиты, а не как галочку «мы защищены». Он снимает процентов 70, а не 100 — часть данных всегда просочится.


📏 Как это проверять

Я закидываю в фильтр документы, которые знаю наизусть, — договоры с юристами и подобное. Так видно и полноту детекта, и лишние теги.

Недавно RnD-команда red_mad_robot выложила бенчмарк для таких проверок:
🔗 Анонс
🔗 Датасет

Я сравнил рекомендацию блогера с облачным анонимайзером NeuralDeep на этом же бенчмарке — облако заметно обходит опенсорс. Правда, честности ради: бенчмарк и облако делает одна команда, так что цифры стоит перепроверять на своих данных.

🎯 Что в итоге делать

Ставить локальные модели и не думать про анонимизацию вообще — если тянете по железу. Нужен локальный фильтр — берите опенсорс и дообучайте до продуктового качества, из коробки он сырой. Данные можно отдавать наружу, а хранить нужно в России — берите российского провайдера с договором, я тестировал на neuraldeep.ru.

Короче, зовите инженеров.

А чем чистите персональные данные вы — и удаётся ли выжать больше 90% полноты на реальных документах?

----

Поляков считает — AI, код и кейсы
  • ❤ 11
  • 👍 7
  • 🔥 6
  • 🤝 1
More from @countwithsasha
  1. Oct 4, 2026Собрал статистику по банам Claude из комментариев в канале Пост с разбором телеметрии, кот…
  2. Oct 2, 2026Возвращаю рубрику сохраняемых постов: сразу большой обзор Так вышло, что рубрика с самыми…
  3. Oct 1, 2026Anthropic снова раздаёт баны: обсуждаем что делать Сегодня утром оживился чат моего канала…
  4. Sep 30, 2026А как вы проверяете свои знания в мире нейронок? Не смотря на то, что плотно сижу в ИИ-чат…
  5. Sep 30, 2026Вы только посмотрите, что сделал наш самый популярный участник чатов про ИИ собрал. Будете…
  6. Sep 29, 2026OpenAI Dev Day 2026 — что показали Так как ребята из OpenAI уже выложили все релиз ноты се…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →