🔹
Как искать дроп-домены, которые одновременно быстро займут топ в Google и начнут получать видимость в ChatGPT, Perplexity, Claude, Grok и Gemini? Неочевидный и малоиспользуемый способ - с помощью Common Crawl.
🔹
commoncrawl.org - это мощный краулер, который ежемесячно сканирует миллиарды страниц и хранит архивные данные в Amazon S3. И все эти данные доступны бесплатно. По многим параметрам он превосходит Wayback Machine, но структура данных абсолютно другая.
🔹
Наибольший интерес представляет веб-граф Common Crawl - это структурированная БД, которая представляет структуру всего Интернета в виде математического графа, где отдельные сайты и разделы выступают в роли "вершин", а ссылки между ними - "ребер".
🔹
Для каждой вершины в графе рассчитываются метрики: PageRank и Harmonic Centrality. Если про PR все в курсе, то последний определяет близость вершины к другим вершинам в графе и его намного сложнее накрутить.
🔹
И самое главное - эти метрики вообще никак не представлены в Ahrefs и других аналогичных сервисах, тем более аукционах.
🔹 Домены, которые непрерывно индексировались в Common Crawl с 2014 года, входят в топ 0,1–0,5% всех хостов в мире. На этих данных обучались абсолютно все LLM-модели и пометили эти сайты, как авторитетные источники, и этот авторитет накапливается с каждой новой итерацией обучения.
🔹 При успешном поиске таких доменов и полном восстановлении контента они опять обнаруживаются краулером Common Crawl (на практике 4-6 недель) и очень скоро появляются в рекомендациях ИИ-сервисов, а также получают ускоренный рост позиций в Google.
🔹 Для анализа индексов Common Crawl я использую AWS Athena и sql-запросы. Это позволяет очень быстро сканировать терабайты информации. Например, выгрузить все уникальные домены, на которые ссылались авторитетные сайты (wikipedia, .gov, .edu, и т.д.) в 2014 году.
🔹 Также можно сформировать sql-запрос и искать по метаданным в файлах WAT. Например, найти страницы, где в текстах или мета-тегах содержится определенного ключевое слово. Так можно собрать мощную нишевую PBN.
🔹 После получения списка доменов я их пробиваю в whois-чекере и expired domains, итоговый список свободных доменов проверяется вручную.
🔹 Для сканирования индексных файлов Common Crawl могу также рекомендовать
CommonCrawl Scanner. Запуск на отдельном сервере показывает высокую производительность.