И это хорошо.
Плохо другое: в чат часто улетает все подряд.
ФИО. Суммы. Номера дел. Доверенности. Паспортные данные. Коммерческие условия. Внутренние детали споров.
А потом все удивляются, почему служба безопасности смотрит на это как на попытку вынести сервер под мышкой.
🔵 Я собрала небольшой
docx-anonymizer — локальный анонимайзер DOCX перед загрузкой документов в нейронку.Видео показываю здесь:
https://youtu.be/tiVB2u_Xp_8
Репозиторий здесь:
https://github.com/irina-probono/docx-anonymizer
⚪ Что он делает:
▪ обезличивает персональные данные;
▪ закрывает коммерческие данные;
▪ маскирует чувствительные данные;
▪ понимает смешанные документы;
▪ отдельно обрабатывает юридические данные: суды, номера дел, стороны, доверенности, нотариальные реестры, даты заседаний, цену иска, кадастровые номера.
🔵 Важно: он не превращает документ в кашу из одинаковых заглушек.
Замены остаются осмысленными:
[PERSONAL_DATA], [COMMERCIAL_DATA], [COMPANY_OOO], [LEGAL_CASE_NUMBER], [CLAIM_AMOUNT].То есть после обработки понятно, что именно было скрыто: человек, компания, сумма, номер дела или другой чувствительный фрагмент.
А оригинал остается отдельно, поэтому при необходимости всегда можно вернуться к исходнику.
⚪ Отдельно можно подключить LLM-агента.
Он не заменяет анонимайзер и не переписывает документ. Его задача — посмотреть на результат и отчет, показать, какие категории данных были закрыты, и дать оценку чувствительности оставшихся фрагментов.
Это удобно для демонстрации, внутреннего контроля и разговора со службой безопасности.
⚫ Заходите в репозиторий: там есть тестовые документы и варианты решения для Windows, Mac и Unix-подобных систем.
Идея простая: сначала чистим документ, потом идем в нейронку.
Не наоборот.
Матерый инхаус — это не «запретить всем ChatGPT».
Это дать людям рабочий контур, где меньше риска и больше контроля.