TGViewer
Mike Blazer Mike Blazer @mikeblazerx · 8.9K subscribers
Post #6722 476
​Настройки сервера и CDN отсекают ИИ-краулеров там, где SEO-софт показывает код 200

Соблюдение robots.txt — дело добровольное.

А вот блокировки на уровне сервера, CDN или фаервола обойти нельзя: запрос жестко отклоняется, и у краулера нет выбора.

Стандартный SEO-софт не выводит эту разницу: при краулинге урл может отдавать 200, тогда как ИИ-краулер получает 403, страницу-заглушку или вообще другой ответ.

Временное окно закрывается.

С 15 сентября 2026 года Cloudflare применяет новые дефолтные правила для свежих доменов: боты, классифицированные как Training или Agent, блокируются на страницах с рекламой, в то время как ботам класса Search доступ открыт.

Это же обновление меняет то, как блокировки ИИ-тренировок (включая старую настройку "Block AI bots") обрабатывают гибридных краулеров Search + Training.

Опенсорсный bash-скрипт bot-block-checker вскрывает эту слепоту без доступа к логам.

Сначала он запрашивает урл со стандартной строкой User-Agent от Chrome, чтобы зафиксировать базу, а затем отправляет тот же запрос, подставляя более 30 строк User-Agent различных ботов и краулеров.

Статус-кода самого по себе недостаточно — 200 может оказаться страницей-заглушкой, — поэтому скрипт также сравнивает размер тела ответа и ищет известные паттерны блокировок относительно базового запроса.

Любой 429 перепроверяется изолированно, чтобы отделить реальную блокировку от ложноположительного срабатывания из-за слишком частых запросов.

Одной локации тоже мало, потому что один и тот же бот получает разные ответы в зависимости от входящего IP.

Прогони тест дважды: с локальной машины на резидентном IP и через Google Cloud Shell на датацентровом IP.

Затем сравнивай результаты:

— Блокировка в обеих средах при доступной базе: конкретное правило против бота, разбирайся с ним в первую очередь.
— Блокировка только в одной среде: проблема на уровне сети, например, фильтрация датацентровых IP или гео-ограничения; само по себе это ничего не доказывает.
— Идентичный успешный ответ везде: нет признаков того, что к этому User-Agent относятся иначе.

Заблокированный бот — это не всегда проблема.

Если сайт отшивает Bytespider, это не бьет по SEO или AEO.

Блокировка становится критичной, когда она срезает краулеров класса Search или Agent, которые должны находить, извлекать или цитировать контент.

Скрипт не может на 100% сымитировать запрос от реального краулера.

Воспринимай любой флаг как сигнал, а не как железобетонное доказательство: подтверждай данные в конфигурации CDN/сервера или логах, прежде чем нести их инфра-команде.

https://athenseo.com/knowledge-hub/how-to-check-if-ai-crawlers-can-actually-reach-your-site/

#AICrawlers #BotBlocking #TechnicalSEO

@MikeBlazerX
📈 "Пушки" — в @MikeBlazerPRO
More from @mikeblazerx
  1. Sep 28, 2026​Логи серверов на четырех доменах вскрывают синхронизированную выкатку кор-апдейта, котору…
  2. Sep 28, 2026​Выгрузки из GSC доказывают: показы Google AI концентрируются на 4–10 позициях, а не в топ…
  3. Sep 26, 2026То, что мы разбираем в @MikeBlazerPRO сегодня, станет баяном в пабликах в 2027-м. Но тогда…
  4. Sep 25, 2026Работает — не трогай! #Humor @MikeBlazerX 📈 "Пушки" — в @MikeBlazerPRO
  5. Sep 25, 2026​Бесплатное Chrome-расширение для хрефленгов 👇 Я написал Hreflang Pro в начале этого года…
  6. Sep 25, 2026​Если вы всё ещё используете трюк с редактированием комментариев на Reddit, завязывайте. Э…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →