Насправді парсинг потрібен частіше, ніж здається: зібрати ціни конкурентів, додати статті у власну базу знань, передати щось агенту тощо.
Ось список інструментів, який варто зберегти.
Готові сервіси, які працюють із коробки
Firecrawl — https://firecrawl.dev/
Перетворює будь-яку сторінку, включно із JS-сайтами та PDF, на чистий markdown для моделі.
Jina AI Reader — https://jina.ai/reader/
Додаєте r.jina.ai перед посиланням і отримуєте чистий текст сторінки. Безкоштовний тариф досить щедрий.
Apify — https://apify.com/
Маркетплейс із 28 тисячами готових скраперів майже для будь-якого популярного сайту.
Thunderbit — https://thunderbit.com/
Розширення для Chrome, яке витягує дані зі сторінки у два кліки та відправляє їх у Sheets або Notion.
RSS.app — https://rss.app/
Перетворює сайти та соцмережі на RSS-стрічку з фільтрами й автопостингом у Telegram.
Відкриті бібліотеки, які можна встановити через агента
Crawl4AI — https://github.com/unclecode/crawl4ai
Популярний open source-скрапер, який одразу віддає сайт у markdown для моделі.
Browser Use — https://github.com/browser-use/browser-use
Агент керує браузером як людина: авторизується, клікає та збирає дані.
Crawlee — https://github.com/apify/crawlee
Фреймворк із ротацією проксі, повторними спробами та чергами, коли сторінок справді багато.
Scrapy — https://github.com/scrapy/scrapy
Промислова класика на Python для обходу мільйонів сторінок.
Scrapling — https://github.com/D4Vinci/Scrapling
Сам адаптується до змін верстки, тому ламається помітно рідше.
AutoScraper — https://github.com/alirezamika/autoscraper
Показуєте приклад потрібних даних — він сам знаходить шаблон і витягує решту.
Defuddle — https://github.com/kepano/defuddle
Очищає сторінку від реклами, меню та сайдбарів. Це рушій Obsidian Web Clipper.
Коли сайт чинить опір
curl_cffi — https://github.com/lexiforest/curl_cffi
Запити з відбитком справжнього браузера — простий спосіб зменшити ймовірність того, що запит буде розпізнаний як бот.
curl-impersonate — https://github.com/lwthiker/curl-impersonate
Схожий підхід на рівні curl, який використовується як рушій для curl_cffi.
CloakBrowser — https://github.com/CloakHQ/CloakBrowser
Заміна Playwright на модифікованому Chromium для роботи із сайтами з антибот-захистом.
invisible_playwright — https://github.com/feder-cr/invisible_playwright
Схожий підхід, але на базі Firefox.