Выгрузка логов основного сервера за 40 дней для крупного
e-commerce домена содержала 45 765 событий с юзер-агентом Googlebot — и 40 157 из них были запросами к /.env, /.ssh/id_ecdsa_sk.priv, /keystore.jks и подобным.То есть около 88% оказались сканерами, подделывающими
UA.В сухом остатке — порядка 5 600 правдоподобно реальных обращений
Googlebot за 30 дней.Остальная часть выгрузки выглядела не лучше: 76 377 из 76 381 событий
www отдавали 3xx на 80 порту без единого 200 — это отскок с HTTP на HTTPS, а не краулинг.А набор
intl_bots, охватывающий примерно две трети данных, вообще не содержал статус-кодов.Согласно Джону Мюллеру: бери для работы меньшую подвыборку (поддомен, если есть), затем сравнивай запросы на краулинг в
GSC с запросами от Google в логах и проверяй, совпадает ли хотя бы тренд.Идеально не будет — Google использует много юзер-агентов, а сайт с тяжелым каталогом товаров или активной рекламой тоже генерирует массу таких обращений.
Статистика сканирования в
GSC также показывает, тормозит ли Googlebot, отваливается ли по тайм-ауту или в целом ловит ошибки.Десять лет полных логов для сайта такого размера — это территория петабайтов, при этом сам объем здесь не главное ограничение.
Если впереди стоит кеш, запросы обрабатываются на
edge-серверах, и основной сервер их никогда не видит.Поэтому логи не дадут ответа, сколько бы дней ни выгружали.
Вместо этого запрашивай предварительно отфильтрованные данные: короткий период, только трафик ботов, с фокусом на масштабируемые разделы сайта, такие как
plp и pdp.Фильтрация сырых логов по юзер-агенту выдает только потенциальных ботов — реального
Googlebot подтверждает обратный поиск по IP.Инсайты комьюнити
— Сначала загрузи 7 дней в
Screaming Frog Log File Analyser, затем добавляй по одному логу в день и следи за паттерном; грузить всё сразу — слишком много информации для анализа. Перед импортом проверь заголовки сырого файла и подтверди, что есть что — в логах IIS поля c-ip и IP клиента WAF легко перепутать, а с Sucuri спереди именно поле IP WAF изолирует Googlebot и Bingbot. Сверяй это с данными краулинга GSC в настройках. Ведущие WAF и CDN по умолчанию не должны блокировать настоящих ботов вроде Googlebot.— Обработка ботов может отличаться в зависимости от фронтенд-окружения, поэтому подтверди, логи какой именно среды тебе передали: в одном случае один фронтенд рапортовал, что каждый бот получает
429, тогда как остальные этого не делали. Некоторые переданные урлы были маршрутами, а не путями, поэтому в ТЗ на выгрузку нужно указывать пути и урлы явно. Отслеживание даже одного случая из GSC обратно в логи подтверждает правильное место и нужного бота; в том же кейсе многие боты, видимые в GSC, оказались не теми, кого ждали, а количество сканирований от самого Googlebot оказалось ниже, чем подразумевал график.#LogFileAnalysis #CrawlBudget #GoogleBot
@MikeBlazerX
📈 "Пушки" — в @MikeBlazerPRO