TGViewer
Mike Blazer Mike Blazer @mikeblazerx · 8.91K subscribers
Post #6723 875
PDF-файлы хоронят ссылочный вес — каноникал в HTTP-хедере перекидывает PageRank на HTML

180 органических ссылок со 109 доменов вели на PDF-файлы одного паблишера, и этот ссылочный вес вообще не дошел до остального сайта.

PDF-документы не содержат валидных исходящих ссылок, поэтому ссылочный граф классифицирует их как висячие узлы (dangling nodes): оригинальный документ по PageRank удаляет висячие ссылки из системы до полного расчета всех весов, а затем возвращает их на втором прогоне.

Позиция Джона Мюллера совпадает с математикой — Google видит ссылки в любых файлах (pdf, xls, doc), но не передает по ним ссылочный вес.

Вес перетекает только через полноценные HTML-ссылки с анкором.

Тест 2012 года изолировал этот эффект.

Научная статья с PageRank 4 содержала две исходящие ссылки, одна из которых вела на свежую тестовую страницу без других входящих линков.

За два года наблюдений PDF не передал никакого видимого PageRank.

HTML-ссылка с той же страницы дала бы PageRank 3 или хотя бы PageRank 2, в зависимости от того, как округлялась четверка — жестко или мягко (3.6–4.4).

Схема обхода подменяет PDF на его HTML-версию в индексе: для этого нужно развернуть HTTP-хедер Link с каноникалом на самом файле.

1. .htaccess:
<Files "doc.pdf">
Header add Link '<HTML-URL>; rel="canonical"
</Files>

2. PHP-обертка:
header('Content-Type: application/pdf');
header('Link <HTML-URL>; rel="canonical"');
readfile('doc.pdf');


Полевой тест прошел на поддомене CDN, где Google выбрал PDF-версию гайда по дизавау вместо HTML-страницы — 121 ссылка с 52 доменов утекала в никуда.

После внедрения в .htaccess HTML-страница захватила выдачу за несколько дней, запросы появились в органике основного домена, а поисковый трафик самой CDN просел, поскольку Google перенес результаты.

Что эта подмена не доказывает: тулбарный PageRank так и не обновился на тестовом урле с каноникалом, и, возможно, не обновится никогда.

Если PageRank висячих узлов — это лишь пост-процессинговая оценка (косметическое значение тулбара), то эти узлы могут быть абсолютно стерильными в плане передачи сигналов, независимо от каноникалов или редиректов.

Ссылки в PDF железобетонно работают только для одной задачи: Googlebot использует их для краулинга и индексации новых страниц.

https://dejanmarketing.com/pdf-hack/

#Canonical #HTTPheaders #LinkEquity

@MikeBlazerX
📈 "Пушки" — в @MikeBlazerPRO
  • ❤ 1
More from @mikeblazerx
  1. Sep 30, 2026Каноникал на Vercel: кластеризатор отбрасывает тег и клеит блог со спамным беттингом Клиен…
  2. Sep 30, 2026​Мы удалили 200 постов в блоге в конце прошлого года, и с тех пор наш трафик из Google выр…
  3. Sep 30, 2026Статистика сканирования в GSC раскрывает запросы Googlebot, которые CDN поглощает до основ…
  4. Sep 29, 2026​Профили поставщиков в госреестрах Австралии отжимают трастовые бэклинки, которые не купит…
  5. Sep 29, 2026Параметры не из вайтлиста пробивают кеш Cloudflare и сносят каноникал На страницах категор…
  6. Sep 28, 2026​Настройки сервера и CDN отсекают ИИ-краулеров там, где SEO-софт показывает код 200 Соблюд…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →