TGViewer
Mike Blazer Mike Blazer @mikeblazerx · 8.91K subscribers
Post #6726 335
Статистика сканирования в GSC раскрывает запросы Googlebot, которые CDN поглощает до основного сервера

Выгрузка логов основного сервера за 40 дней для крупного e-commerce домена содержала 45 765 событий с юзер-агентом Googlebot — и 40 157 из них были запросами к /.env, /.ssh/id_ecdsa_sk.priv, /keystore.jks и подобным.

То есть около 88% оказались сканерами, подделывающими UA.

В сухом остатке — порядка 5 600 правдоподобно реальных обращений Googlebot за 30 дней.

Остальная часть выгрузки выглядела не лучше: 76 377 из 76 381 событий www отдавали 3xx на 80 порту без единого 200 — это отскок с HTTP на HTTPS, а не краулинг.

А набор intl_bots, охватывающий примерно две трети данных, вообще не содержал статус-кодов.

Согласно Джону Мюллеру: бери для работы меньшую подвыборку (поддомен, если есть), затем сравнивай запросы на краулинг в GSC с запросами от Google в логах и проверяй, совпадает ли хотя бы тренд.

Идеально не будет — Google использует много юзер-агентов, а сайт с тяжелым каталогом товаров или активной рекламой тоже генерирует массу таких обращений.

Статистика сканирования в GSC также показывает, тормозит ли Googlebot, отваливается ли по тайм-ауту или в целом ловит ошибки.

Десять лет полных логов для сайта такого размера — это территория петабайтов, при этом сам объем здесь не главное ограничение.

Если впереди стоит кеш, запросы обрабатываются на edge-серверах, и основной сервер их никогда не видит.

Поэтому логи не дадут ответа, сколько бы дней ни выгружали.

Вместо этого запрашивай предварительно отфильтрованные данные: короткий период, только трафик ботов, с фокусом на масштабируемые разделы сайта, такие как plp и pdp.

Фильтрация сырых логов по юзер-агенту выдает только потенциальных ботов — реального Googlebot подтверждает обратный поиск по IP.

Инсайты комьюнити

— Сначала загрузи 7 дней в Screaming Frog Log File Analyser, затем добавляй по одному логу в день и следи за паттерном; грузить всё сразу — слишком много информации для анализа. Перед импортом проверь заголовки сырого файла и подтверди, что есть что — в логах IIS поля c-ip и IP клиента WAF легко перепутать, а с Sucuri спереди именно поле IP WAF изолирует Googlebot и Bingbot. Сверяй это с данными краулинга GSC в настройках. Ведущие WAF и CDN по умолчанию не должны блокировать настоящих ботов вроде Googlebot.
— Обработка ботов может отличаться в зависимости от фронтенд-окружения, поэтому подтверди, логи какой именно среды тебе передали: в одном случае один фронтенд рапортовал, что каждый бот получает 429, тогда как остальные этого не делали. Некоторые переданные урлы были маршрутами, а не путями, поэтому в ТЗ на выгрузку нужно указывать пути и урлы явно. Отслеживание даже одного случая из GSC обратно в логи подтверждает правильное место и нужного бота; в том же кейсе многие боты, видимые в GSC, оказались не теми, кого ждали, а количество сканирований от самого Googlebot оказалось ниже, чем подразумевал график.

#LogFileAnalysis #CrawlBudget #GoogleBot

@MikeBlazerX
📈 "Пушки" — в @MikeBlazerPRO
  • ⚡ 1
More from @mikeblazerx
  1. Sep 29, 2026​Профили поставщиков в госреестрах Австралии отжимают трастовые бэклинки, которые не купит…
  2. Sep 29, 2026Параметры не из вайтлиста пробивают кеш Cloudflare и сносят каноникал На страницах категор…
  3. Sep 29, 2026PDF-файлы хоронят ссылочный вес — каноникал в HTTP-хедере перекидывает PageRank на HTML 18…
  4. Sep 28, 2026​Настройки сервера и CDN отсекают ИИ-краулеров там, где SEO-софт показывает код 200 Соблюд…
  5. Sep 28, 2026​Логи серверов на четырех доменах вскрывают синхронизированную выкатку кор-апдейта, котору…
  6. Sep 28, 2026​Выгрузки из GSC доказывают: показы Google AI концентрируются на 4–10 позициях, а не в топ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →