1️⃣ Собственно, первый вы уже поняли: нужно изучать, как устроены сайты, с которых вы хотите что-то скрапить и парсить. Нужно и глазами покопаться, и призвать на помощь нейросети: я просто сохраняла в браузере html-файлики с основной страницей поисковых фильтров, со страницей дела (где есть caseID) и страницей решения. Так и нейросети будет легче составлять код скрапера.
2️⃣ Просите закодить небольшую паузу в посылании запросов, чтобы сайт не решил, что его дудосят, и не выдал бан вашему IP (особенно если это какой-то реальный IP, с которого вы по работе часто взаимодействуете с сайтом).
3️⃣ Если для каких-то целей вы используете сервисы из трех букв, то на время скрапинга баз решений российских гос.орагнов ковровую активность этих сервисов придется приостанавливать — будьте к этому готовы.
4️⃣ Используйте обязательно логи того, где скрапер побывал и что скачал — если будут какие-то прерывания в соединении, или вы будете скрапить с какой-то регулярностью, это будет совершенно бесценной информацией, экономящей кучу времени.
5️⃣ Помните, что структурированные базы — это вообще-то охраняемый результат интеллектуальной деятельности, и полезно на всякий случай чекать режим допустимого использования. У ФАС об этом вот здесь, например (к вопросу о коммерциализации) 📈
Материалы сайта ФАС России являются общедоступными и открытыми для использования в некоммерческих (личных, ознакомительных, образовательных, исследовательских и аналогичных) целях.
Кстати, хотите hot tea на тему коммерциализации с Форума Правотеха? 👩❤️👨 Ну какой растущий канал без hot tea, извините меня… Будет завтра! Я хотела предложить читателям сказать, нужно ли выложить код скрапера, но с новыми вводными даже не знаю уже))
Поэтому просто рассказывайте о своем опыте скрапопарсинга и приколах, с которыми пришлось столкнуться.