180 органических ссылок со 109 доменов вели на
PDF-файлы одного паблишера, и этот ссылочный вес вообще не дошел до остального сайта.PDF-документы не содержат валидных исходящих ссылок, поэтому ссылочный граф классифицирует их как висячие узлы (dangling nodes): оригинальный документ по PageRank удаляет висячие ссылки из системы до полного расчета всех весов, а затем возвращает их на втором прогоне.Позиция Джона Мюллера совпадает с математикой — Google видит ссылки в любых файлах (
pdf, xls, doc), но не передает по ним ссылочный вес.Вес перетекает только через полноценные
HTML-ссылки с анкором.Тест 2012 года изолировал этот эффект.
Научная статья с
PageRank 4 содержала две исходящие ссылки, одна из которых вела на свежую тестовую страницу без других входящих линков.За два года наблюдений
PDF не передал никакого видимого PageRank.HTML-ссылка с той же страницы дала бы PageRank 3 или хотя бы PageRank 2, в зависимости от того, как округлялась четверка — жестко или мягко (3.6–4.4).Схема обхода подменяет
PDF на его HTML-версию в индексе: для этого нужно развернуть HTTP-хедер Link с каноникалом на самом файле.1.
.htaccess:<Files "doc.pdf">
Header add Link '<HTML-URL>; rel="canonical"
</Files>
2.
PHP-обертка:header('Content-Type: application/pdf');
header('Link <HTML-URL>; rel="canonical"');
readfile('doc.pdf');Полевой тест прошел на поддомене
CDN, где Google выбрал PDF-версию гайда по дизавау вместо HTML-страницы — 121 ссылка с 52 доменов утекала в никуда.После внедрения в
.htaccess HTML-страница захватила выдачу за несколько дней, запросы появились в органике основного домена, а поисковый трафик самой CDN просел, поскольку Google перенес результаты.Что эта подмена не доказывает: тулбарный
PageRank так и не обновился на тестовом урле с каноникалом, и, возможно, не обновится никогда.Если
PageRank висячих узлов — это лишь пост-процессинговая оценка (косметическое значение тулбара), то эти узлы могут быть абсолютно стерильными в плане передачи сигналов, независимо от каноникалов или редиректов.Ссылки в
PDF железобетонно работают только для одной задачи: Googlebot использует их для краулинга и индексации новых страниц.https://dejanmarketing.com/pdf-hack/
#Canonical #HTTPheaders #LinkEquity
@MikeBlazerX
📈 "Пушки" — в @MikeBlazerPRO