Буржуйский сеошник Гленн Гейб
рассказывает, как найти все PDF-файлы, которые были недавно удалены из индекса, используя API Search Console, API проверки URL-адресов и Analytics Edge.
"Недавно Google начал массово исключать PDF-файлы из индекса, что впервые заметила Саванна Грей в LinkedIn. Для многих сайтов эти PDF-файлы переместились в раздел «Просканированы, но не проиндексированы» в отчетах Google Search Console. Судя по масштабу влияния на сайты, похоже, это более серьезное изменение в системах Google, а не специфичное для этих сайтов. И, честно говоря, это не удивительно. Я всегда говорил клиентам, что если у них есть контент в формате PDF, который ранжируется, им следует перепрофилировать этот контент в HTML. PDF-файлы неудобны, особенно на мобильных устройствах. Кроме того, они могут быть очень большими по размеру. Тем не менее, бывают случаи, когда на сайтах много PDF-файлов, которые ранжируются, и перепрофилирование — непростая задача. Поэтому сайты, которые просто сохранили PDF-файлы без перепрофилирования, могли наблюдать резкое падение показов и кликов по PDF-файлам, поскольку Google исключил многие из них из индекса по всему интернету."
Что-то мне как-то сомнительно, что гуглоиды перевели пдф-ники в thin контент только из-за формата. Часто бывает, что на pdf-файл стоит на всем сайте одна единственная ссылочка с какой-нибудь богом забытой html-страницы. Возможно, чуть изменился порог срабатывания классификатора thin-контента, и такие пдф-ки массово поулетали.