Как вытаскивать данные с самых упрямых сайтов: 4 продвинутых метода веб-скрейпинга
Дата-журналист Саймон Виллисон провёл на конференции NICAR 2025 крутой воркшоп про новейшие методы веб-скрейпинга.
Собрала самое главное:
1. Git-скрейпинг
Автоматически следим за изменениями на сайте и сохраняем историю в GitHub через GitHub Actions. Полезно для отслеживания цен, публикаций госданных и статистики.
2. JavaScript + shot-scraper
Запускаем JavaScript прямо в браузере или через командную строку (shot-scraper). Полезно при автоматизации сбора данных с сайтов, устойчивых к классическим методам парсинга. А еще для бесконечной прокрутки — как в Twitter.
3. Нейросети для извлечения структурированных данных
GPT-4o и Gemini отлично извлекают структурированную информацию из плохо размеченных сайтов — например, пдфки и даже изображения. Новая фишка — поддержка схем данных.
4. Видео-скрейпинг
Когда сайт ну совсем не даёт собирать данные, делаем захват экрана, загружаем видео в Google AI Studio и получаем таблицу. Работает даже с самыми защищёнными ресурсами.
Саймон также придумал как безопасно раздавать API-ключи участникам воркшопов через страницу с зашифрованным сообщением. Попробовать можно тут: tools.simonwillison.net/encrypt (пароль: "demo").
#дата_журналистика #скрейпинг #полезное
Post #64
277