Scrapy — Python-фреймворк для веб-скрейпинга. Идеально подходит для:
➖ Сбора данных
➖ Поиска уязвимостей и метаданных
➖ OSINT и аналитики
Как работает:
1. Для начала нужно установить Scrapy. Это можно сделать через pip:
pip install scrapy
2. Создайте новый проект с помощью команды:
scrapy startproject myproject
3. Создайте новый файл паука в каталоге spiders/ вашего проекта:
scrapy genspider example_spider example.com
4. Пример паука:
import scrapy
class ExampleSpider(scrapy.Spider):
name = "example_spider"
start_urls = ['https://www.example.com']
def parse(self, response):
yield {
'title': response.xpath('//title/text()').get(),
'url': response.url,
}
5. После настройки паука вы можете запустить его с помощью команды:
scrapy crawl example_spider -o output.json
Советы по использованию:
— Настройте
DOWNLOAD_DELAY— Используйте обработку ошибок
— Применяйте разные User-Agent / Proxy
🐸Библиотека хакера
#буст
