TGViewer
Channel Public Channel
Артём Акулов | Парсинг сайтов

Артём Акулов | Парсинг сайтов

@scrapeprofy

🔹Консультация: @akulovartem
🔹Работать со мной: Scrapeprofy.ru
🔹Youtube.com/@AkulovPRO
🔹Rutube.ru/channel/46383760/
🔹Канал про SEO: @akulov_pro
🔹Обучением не занимаюсь
🔹Рекламы на канале нет
Subscribers
180
Photos
4
Videos
0
Links
8
Recent Posts 14 shown
Post #19 190

Forwarded from Артём Акулов | SEO и Накрутка ПФ

🔹 Backlink Checker - сделал новый софт для автоматизированной проверки сайтов-доноров на наличие ссылок на продвигаемые сайты с последующим анализом качества данных ссылок.

🔹 Что делает:

- Полный рендеринг JS. Загружает каждую страницу-донор через Chromium, что позволяет эффективно обнаруживать ссылки.

- Автопрокрутка для активации lazy-load.

- Ищет ссылки на все указанные целевые домены, включая поддомены.

- Анализирует тип ссылки: dofollow, nofollow, UGC, sponsored.

- Определяет тип анкора: текстовый или графический (img с alt-текстом).

- Определяет текст анкора: извлекается из текста ссылки, alt-текста изображения или title.

- Определяет текстовое окружение: фрагмент исходного кода страницы ±200 символов вокруг ссылки.

- Проверяет canonical: нет ли канонизации на другую страницу.

- Проверка доступности индексации страницы: отдельно для Google, Yandex, Bing, Baidu.

- Можно использовать любой user-agent для сканирования.

- Реализован подробный экспорт в Excel.

🔹 Скачать - https://artemakulov.ru/backlink-checker/

🔹 Не требует установки - один exe-файл, данные хранятся локально.

🔹 В планах: добавить интеграции с Claude и APIs Ahrefs, Majestic, Similarweb через rapidapi.
  • 👍 4
  • ⚡ 3
  • 🔥 3
Post #18 299

Forwarded from Артём Акулов | SEO и Накрутка ПФ

SEO FOOTPRINTS.pdf217.8 KB
🔹 SEO Footprints - парсим всё что угодно из поисковой системы Google.

🔹 Фактически, Google - это самая большая база данных в мире и мы можем получить любые данные, которые можем использовать в своих интересах при продвижении сайтов.

🔹 Футпринты - это признаки, по которым мы можем найти определенные сайты для формирования собственной базы, которую дальше можем использовать для линкбилдинга, исследований, уровней ссылок, и ссылочных прогонов.

🔹 В приложении к посту моя шпаргалка с SEO футпринтами. Её легко можно масштабировать под собственные задачи.

🔹 Рекомендую изучить сайт https://trends.builtwith.com/ru/cms и искать непопулярные CMS, таким образом создать собственную уникальную базу. В интерфейсе имеется удобное распределение по странам, в один клик можно проверить какие CMS предпочитают использовать в определённом гео.
  • 👍 4
  • ⚡ 2
  • 🔥 2
Post #17 1.61K
Парсинг Avito и 2Gis.

Готовы два мощных парсера. Для заказа пишите мне @akulovartem.

🔹 Парсер Avito.

- Фильтр по любым городам и продавцам.
- Мониторинг и парсинг новых объявлений в реальном времени.
- Сбор всех данных из карточки объявления.
- Выгрузка данных в Excel.

🔹 Парсер 2Gis.

- Фильтр по любым городам и районам.
- Любые рубрики и поисковые запросы.
- Сбор всех данных из карточек компаний.
- Экспорт данных в CSV/XLSX.
  • 🔥 5
  • 👍 3
  • ⚡ 2
Post #16 1.3K
Артём Акулов | Парсинг сайтов 🔹 Вчера боту было отправлено 159588 доменов на анализ, ну вы блин даёте! 🔹 Короче, API Similarweb начал отдавать ошибки доступа, да еще и заблочилась БД из-за некорректного завершения сессий. 🔹 Сделал новую обработку сессий, обновил конфиг на сервере, залил…
От большого количества обращений зависла база + обновил библиотеки, все работает, тестируйте у себя @Similarweb_Scraper_Bot
  • 👍 5
  • ⚡ 2
  • 🔥 2
Post #13 1.81K
🔹 Вчера боту было отправлено 159588 доменов на анализ, ну вы блин даёте!

🔹 Короче, API Similarweb начал отдавать ошибки доступа, да еще и заблочилась БД из-за некорректного завершения сессий.

🔹 Сделал новую обработку сессий, обновил конфиг на сервере, залил 10к новых user-agent'ов и рандомизацию заголовков для более стабильного парсинга.

🔹 Счетчик проверок обнулил для всех, мало ли отправили запросы, результат не получили, а лимиты списались.

🔹 Все работает: @Similarweb_Scraper_Bot
  • 👍 7
  • 🔥 3
  • ⚡ 2
Post #12 3.74K
🔹 Парсер SimilarWeb: сбор и анализ данных о трафике сайтов прямо в Telegram

🔹 Ссылка на бота: @Similarweb_Scraper_Bot

🔹 Сервис будет полезен владельцам сайтов, SEO-специалистам, интернет-маркетологам.

🔹 Получайте данные по доменам, анализируйте распределение трафика по источникам и странам. Принимайте более точные решения при анализе конкурентов, линкбилдинге, покупке дроп-доменов и построении PBN.

🔹 Какие данные доступны для анализа?

- тематика сайта (категория);
- гео;
- рейтинг в стране;
- рейтинг в категории;
- среднее время нахождения пользователей на сайте;
- показатель отказов;
- глубина просмотра;
- трафик за последние 3 месяца;
- топ-5 стран по трафику;
- источники трафика (прямые переходы, поиск, и т.д.);
- топ-5 ключевых слов, по которым переходят пользователи на сайт (трафик и стоимость клика).

🔹 Пользоваться очень просто: отправляете домен или список доменов, каждый с новой строки или загрузите текстовый файл (.txt) со списком доменов и получите отчеты в форматах XLSX, CSV, JSON.
  • 🔥 7
  • ⚡ 2
  • 👍 2
Post #11 475
🔹 Новости и апдейты.

🔹 Допиливаю Similarweb Scraper - мой продукт для SEO и конкурентной разведки.

🔹 Официальная подписка на Similarweb достаточно дорогая и с большими ограничениями, мой вариант - гораздо дешевле.

🔹 Инструмент предоставляет глубокую аналитику о трафике сайтов, включая посещаемость, источники трафика, поведенческие метрики, рейтинги, ключевые слова, и многое другое.​

🔹 Готовые данные выгружаются в CSV и JSON.

🔹 Могу упаковать в Telegram-бота и сделать подписку с демо-доступом. Кому интересно - ставьте лайк к этому посту и пишите мне по всем вопросам.

🔹 PS: В разработке также находится парсер Ahrefs с огромным перечнем возможностей, об этом будет отдельный пост.
  • 🔥 11
  • 👍 8
  • 🐳 3
Post #9 1.8K
🔹 Делюсь собственной бесплатной программой для написания контента с помощью AI.

🔹 Функционал: парсит текстовый контент с предоставленных URL, пишет статью на основе этого контента, редактирует статью.

🔹 Можно использовать свои промпты для написания и редактирования статьи.

🔹 Для работы потребуется собственный ключ от OpenAI.

🔹 Работает на GPT4o.

🔹 Результат можно сохранить в txt-файл.

🔹 Никакие личные данные, а тем более ключи OpenAI не собираются и никуда не передаются, это легко проверить посмотрев исходный код программы.

🔹 Скачать можно тут - https://disk.yandex.ru/d/Noe-v-Qs3_GS2A

🔹 PS: кому интересно - напишите мне, могу расширить функционал.
  • 🔥 8
  • 👍 3
  • ⚡ 2
Post #8 420
🔹 Новый проект: парсер тысяч изображений с техническими спецификациями оборудования.

🔹 Реализовал на Patchright и Scrapy.

🔹 Логика работы:
загружаем контент с динамического сайта конкурента, затем передаём данные в Scrapy для многопоточного парсинга и сохранения данных в папку на сервере.

🔹 Конфиг Patchright (используется реальный браузер Chrome):

context = await p.chromium.launch_persistent_context(
user_data_dir=user_data_dir,
channel="chrome",
headless=True,
no_viewport=True
)


🔹 Отключаю загрузку картинок и видео для ускорения работы и экономии ресурсов:

await context.route("**/*.{png,jpg,jpeg,gif,webp,svg,mp4,avi,mov}", lambda route: route.abort())


🔹 Контент страницы подгружается только по мере скролинга, поэтому был реализован быстрый скролл до конца страницы с помощью цикла:

page = await context.new_page()
await page.goto(url)
await page.wait_for_load_state("domcontentloaded")

if await page.evaluate("document.body.scrollHeight > window.innerHeight"):
last_position = 0
while True:
await page.evaluate("window.scrollBy(0, 50000);")
await asyncio.sleep(0.5)
new_position = await page.evaluate("window.scrollY")
if new_position == last_position:
break
last_position = new_position


🔹 Конфиг Scrapy для многопоточного парсинга:

process = CrawlerProcess(settings={
'CONCURRENT_REQUESTS': MAX_CONCURRENT_TASKS,
'LOG_LEVEL': 'ERROR',
'RANDOMIZE_DOWNLOAD_DELAY': True,
'HTTPCACHE_ENABLED': True,
'HTTPCACHE_EXPIRATION_SECS': 86400,
'RETRY_ENABLED': True,
'RETRY_TIMES': 5,
'RETRY_HTTP_CODES': [500, 502, 503, 504, 408, 429, 403, 404, 410],
'COOKIES_ENABLED': True,
'DEFAULT_REQUEST_HEADERS': headers,
'ROBOTSTXT_OBEY': False
})


🔹 Результат: быстрая обработка больших объемов данных, загрузка 5000 файлов занимает в районе 1 минуты, при проблемах скачивания программа автоматически делает повторные попытки в к-ве 5 штук, к-во потоков - 15.
  • 👍 7
  • 🔥 4
  • 🐳 2
Post #7 1.13K
Артём Акулов | Парсинг сайтов ​​⚡️ Парсинг сайтов для бизнеса: автоматизация, фишки и лайфхаки 🔹 31 марта в 16:00 по Москве смотрите мой вебинар совместно с Михаилом Шакиным. 🔹 Темы, которые я разберу: - Что такое парсинг сайтов и зачем он нужен бизнесу? - Как выбрать инструменты для…
Стрим.png5.4 MB
🔹 Оформил стрим в статью на vc.ru для удобства - https://vc.ru/marketing/1914236-parsing-saitov-dlya-biznesa

🔹 Подписывайтесь на мой аккаунт на vc.ru, веду с 2015 года - https://vc.ru/u/35786-artem-akulov

🔹 Для работы активно использую https://notebooklm.google.com: быстро суммирует и анализирует информацию сразу из нескольких источников (включая любое видео с Youtube), автоматически организует заметки, полная интеграция с экосистемой Google, адаптирует и ускоряет обучение в нужной области, автоматически строит mind map (пример карты на основе инфы из вебинара в этом посте).
  • 🔥 10
  • 👍 3
  • ⚡ 2
Post #6 1.44K
​​⚡️ Парсинг сайтов для бизнеса: автоматизация, фишки и лайфхаки

🔹 31 марта в 16:00 по Москве смотрите мой вебинар совместно с Михаилом Шакиным.

🔹 Темы, которые я разберу:

- Что такое парсинг сайтов и зачем он нужен бизнесу?

- Как выбрать инструменты для парсинга и вытащить данные с любого сайта конкурента?

- Что могут и когда применять самые популярные библиотеки для парсинга: Requests и BeautifulSoup?

- Как парсить динамические сайты с помощью Selenium и Playwright?

- Как обойти механизмы защиты сайтов от парсинга?

- Что такое Undetected Chromedriver и Patchright?

- Как парсить сайты с помощью нейросетей: обзор ScrapeGraphAI и Crawl4AI?

- Как установить нейросеть на свой компьютер?

- Лайфхаки для парсинга: Crontab UI, Jsonformatter и Curlconverter.

- Парсим сайты в промышленных масштабах: обзор фреймворка Scrapy и Scrapyd.

- Парсим Telegram: обзор фреймворков Telethon и Pyrogram.

🔹 Практика

- Парсим vc.ru и aviationstack по API.
- Парсим сайт с помощью нейросети.
- Парсим исходящие ссылки сайта и ищем дроп-домены.
- Настраиваем краулер для любого сайта, парсим и анализируем все данные.
- Парсим любое видео/аудио с Youtube одной строчкой кода.
  • 👍 7
  • 🔥 3
  • 👨‍💻 2
Post #3
Артём Акулов | Парсинг сайтов pinned «⚡ Приветствую! Меня зовут - Акулов Артем, и это мой официальный телеграм-канал посвященный парсингу сайтов, программированию, нейросетям, AI-агентам и передовым технологиям. 🔹Сотрудничество/Обсудить проект или задачу: 💬 https://t.me/akulovartem 📬 akulov…»
Post #2 409
⚡ Приветствую! Меня зовут - Акулов Артем, и это мой официальный телеграм-канал посвященный парсингу сайтов, программированию, нейросетям, AI-агентам и передовым технологиям.

🔹Сотрудничество/Обсудить проект или задачу:

💬 https://t.me/akulovartem
📬 akulov.artem.seo@yandex.ru

🔹 Мой сайт, готовые базы данных и полезные материалы: https://scrapeprofy.ru

🔹Здесь будут публиковаться гайды, лонгриды, кейсы, инструкции, вебинары, и мой личный опыт в парсинге сайтов и обработке данных.

🔹По мере появления свободного времени и желания я публикую статьи в личном блоге на vc.ru.

🔹 Записи вебинаров можно посмотреть на моем Youtube-канале.

🔹 Мой второй канал про SEO и накрутку ПФ - https://t.me/akulov_pro

🔹 Веду собственный подкаст, он доступен на следующих платформах:

Смотреть:
📹 Youtube/Rutube
📱 Dzen

Слушать:
💬 VK
🎵 Яндекс.Музыка
🍰 Литрес
🎵 Spotify
🎙 Apple Podcasts
  • 👍 7
  • 🔥 3
  • 👨‍💻 2
Post #1
Channel created

About this channel

How can I read @scrapeprofy without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Артём Акулов | Парсинг сайтов: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Артём Акулов | Парсинг сайтов have?
Артём Акулов | Парсинг сайтов (@scrapeprofy) has 180 subscribers on Telegram, refreshed roughly every 30 minutes.
Does Артём Акулов | Парсинг сайтов know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →