Регексы против рекламных обещаний: как мы это мерили и почему первый прогон наврал вдвое
Нам нужны были свои цифры по страницам, которые впаривают франшизы. Не чьё-то мнение и не галерея скринов, а числа, которые через полгода можно пересчитать и сравнить. Готовых датасетов по этой нише нет, так что пришлось накатить скрипт: он берёт 16 страниц, прогоняет их по списку признаков и скидывает всё в JSON.
Первая выгрузка смотрелась бодро. А потом мы открыли страницы руками и увидели, что по одному признаку скрипт промахнулся больше чем в два раза. Дальше — про то, где именно регулярка цепляет слово, но не цепляет смысл, и что делать, если выкинуть регексы совсем не вариант.
Читать далее
👉 About Python
Post #3133
336
