TGViewer
Badass SEO 🌭 Badass SEO 🌭 @badseo · 1.86K subscribers
Post #217 1.17K

Forwarded from Я тестую: SEO та ШІ 🇺🇦

Чим витягувати дані з будь-якого сайту та як парсити за допомогою агентів
Насправді парсинг потрібен частіше, ніж здається: зібрати ціни конкурентів, додати статті у власну базу знань, передати щось агенту тощо.
Ось список інструментів, який варто зберегти.
Готові сервіси, які працюють із коробки
Firecrawl — https://firecrawl.dev/
Перетворює будь-яку сторінку, включно із JS-сайтами та PDF, на чистий markdown для моделі.

Jina AI Reader — https://jina.ai/reader/
Додаєте r.jina.ai перед посиланням і отримуєте чистий текст сторінки. Безкоштовний тариф досить щедрий.

Apify — https://apify.com/
Маркетплейс із 28 тисячами готових скраперів майже для будь-якого популярного сайту.

Thunderbit — https://thunderbit.com/
Розширення для Chrome, яке витягує дані зі сторінки у два кліки та відправляє їх у Sheets або Notion.

RSS.apphttps://rss.app/
Перетворює сайти та соцмережі на RSS-стрічку з фільтрами й автопостингом у Telegram.

Відкриті бібліотеки, які можна встановити через агента
Crawl4AI — https://github.com/unclecode/crawl4ai
Популярний open source-скрапер, який одразу віддає сайт у markdown для моделі.

Browser Use — https://github.com/browser-use/browser-use
Агент керує браузером як людина: авторизується, клікає та збирає дані.

Crawlee — https://github.com/apify/crawlee
Фреймворк із ротацією проксі, повторними спробами та чергами, коли сторінок справді багато.

Scrapy — https://github.com/scrapy/scrapy
Промислова класика на Python для обходу мільйонів сторінок.

Scrapling — https://github.com/D4Vinci/Scrapling
Сам адаптується до змін верстки, тому ламається помітно рідше.

AutoScraper — https://github.com/alirezamika/autoscraper
Показуєте приклад потрібних даних — він сам знаходить шаблон і витягує решту.

Defuddle — https://github.com/kepano/defuddle
Очищає сторінку від реклами, меню та сайдбарів. Це рушій Obsidian Web Clipper.

Коли сайт чинить опір
curl_cffi — https://github.com/lexiforest/curl_cffi
Запити з відбитком справжнього браузера — простий спосіб зменшити ймовірність того, що запит буде розпізнаний як бот.

curl-impersonate — https://github.com/lwthiker/curl-impersonate
Схожий підхід на рівні curl, який використовується як рушій для curl_cffi.

CloakBrowser — https://github.com/CloakHQ/CloakBrowser
Заміна Playwright на модифікованому Chromium для роботи із сайтами з антибот-захистом.

invisible_playwright — https://github.com/feder-cr/invisible_playwright
Схожий підхід, але на базі Firefox.
Firecrawl - The web data API to search, scrape, and interact with the web at scale. 🔥 Firecrawl is the web data API to search, scrape, and interact with the web at scale. Turn any source into clean Markdown or structured data your agents can ship with.
  • 👍 36
  • 🤝 4
  • 🦄 3
  • 👎 2
  • 👀 1
  • 😇 1
More from @badseo
  1. Sep 8, 2026Завтра о 17-00 говоримо про Fanout Query 1) що це взагалі та які типи підзапитів використо…
  2. Sep 7, 2026Як не спалити квоту Ahrefs API на дроп-доменах це я більше для себе, щоб не забути, а може…
  3. Aug 27, 2026таблички то круто, але бази даних то вже справжній рок-н-ролл ✌ https://seobaza.com.ua/art…
  4. Aug 25, 2026Завтра середа! А це означає новий лайв! Поговоримо про RAG для SEO. ⏰ 26 серпня о 18:30 ⠀…
  5. Aug 13, 2026Здоров колеги, це Саша Белевець Шукаю собі в команду майбутнього Head of PBN - прямий репо…
  6. Aug 12, 2026середа повертається, чуваки ! https://www.youtube.com/watch?v=KWVVKLsi6NE
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →