WaterCrawl
Снова наткнулся на мощный инструмент для веб-скрейпинга и извлечения данных на GitHub — WaterCrawl.
Он построен на базе Python + Scrapy, эффективно парсит веб-страницы и извлекает нужные данные, при этом поддерживает многоязычный контент и мониторинг прогресса в реальном времени.
Ключевые возможности:
🔸Продвинутый веб-краулер с настраиваемой глубиной обхода, скоростью и целевыми элементами
🔸Встроенный мощный поисковый движок с тремя уровнями глубины: базовый, расширенный и предельный
🔸Поддержка многоязычного парсинга, включая поиск по странам
🔸Асинхронная архитектура, с возможностью реального времени мониторинга через SSE
🔸Полноценный REST API с поддержкой OpenAPI-документации
🔸Глубокая интеграция с AI- и автоматизационными платформами, такими как Dify и N8N
Также доступна быстрая установка через Docker, плюс поддержка SDK на Python, Node.js, Go, PHP и других языках.
📁 Language: #TypeScript (55.4%), #Python (29.2%)
⭐️ Stars: 449
➡️ Cсылка на GitHub
📱 @git_developer
Post #793
4.29K

- 👍 10
- ❤ 1