Небольшой апдейт по сервису обезличивания данных. Протестировал я его на некотором количестве примеров, на разных LLM. И понял, что можно сильно уменьшить количество ложных срабатываний детекторов, если просто... разрешить им искать только те виды данных, с которыми они хорошо справляются. А с которыми не справляются - не разрешить. 😆
Основные ограничения коснулись названий организаций и адресов. Их нормально определял только детектор Natasha. Важная оговорка - я работал с примерами на русском языке.
В итоге получилось такое распределение обязанностей:
1. regex - e-mail, телефон, банковские карты, ИНН, СНИЛС, паспорт, IP-адреса
2. Natasha - имена, организации, адреса, даты
3. Presidio + spaCy (ru_core_news_lg) - имена, банковские карты, ИНН, СНИЛС, паспорт, IP-адреса, даты
4. Локальная LLM - имена, даты
В качестве локальной LLM при такое подходе хорошо себя показала qwen3.5-9b.
Все изменения уже на GitHub.
@Konstantin1C
Post #108
446

- 👍 6
- 🔥 2