Этот Python-фреймворк может скрейпить ЛЮБОЙ сайт и вытаскивать структурированные данные за считанные минуты.
Называется Scrapy. Он краулит сайты и извлекает структурированные данные целиком с твоей машины.
Никаких счетов за SaaS-скрейпинг. Никаких лимитов облачных API. Никакие данные не уходят за пределы твоей инфраструктуры.
Работает на самом “боевом” краулинг-движке в Python: 59K звёзд и 15+ лет продакшен-использования.
→ Описал spider один раз
→ Получил чистые структурированные данные
→ Масштабируешься до миллионов страниц
→ Экспорт в JSON, CSV, XML в один момент
Всё локально. Ноль зависимости от облака.
Но это не просто скрипт для парсинга.
Это полноценный фреймворк для извлечения данных:
→ Асинхронная архитектура для параллельного краулинга в масштабе
→ Встроенные middleware для прокси, ретраев и rate limiting
→ CSS и XPath селекторы без лишнего бойлерплейта
→ Подключаемые pipelines для чистки, дедупликации и сохранения
→ 54 800+ продакшен-проектов уже завязаны на него
100% open source. Лицензия BSD-3.
Работает на macOS, Windows и Linux уже сейчас.
Хочешь сделать хорошо, сделай сам, вместо облачных сервисов запускаешь всё у себя. 🪖🪖
100% опенсорс
👉 @PythonPortal
Post #5554
6.98K

- ❤ 19
- 👍 4