Стою в очереди в известной кофейне. Диалог на кассе:
— Для кого делаем кофе?
— Натал*я.
— Через «и» или мягкий знак?
Ухом зацепился — профдеформация. Подхожу ближе и вижу на бейдже: «Наташа». Сразу понятно — человек всю жизнь эти буквы уточняет :)
Казалось бы, ну буква ерундовая. Но я очень люблю этот пример. Мы в HFLabs уже 21 год исправляем ошибки в именах и ищем дубликаты в клиентских базах. Наталья и Наталия нельзя приводить к одному виду — это разные имена. Спросите у любой Натальи. Или Наталии. А вот при поиске дублей мы понимаем: это точно один человек, просто в одной из записей опечатались.
Опытные алгоритмисты тут же вспоминают расстояние Левенштейна — меру того, насколько отличаются две последовательности символов. А теперь сравните: Наталья — Наталия и Саша — Маша. Расстояние Левенштейна одно и то же. А разница огромная.
Кажется: сделал один раз алгоритмы исправления опечаток и поиска дубликатов — и спи спокойно. Однако мы до сих пор вместе с клиентами продолжаем эти алгоритмы улучшать. Подводных камней там хватает.
И вот у нас уже AI на дворе. А человека в базе до сих пор могут не найти из-за какой-нибудь буквы Ё.
Post #200
601
- ❤ 25
- 💯 15
- 🔥 12
- 😁 5