Кластеризация - какую таблетку ты выберешь?
Начну с метафоры. Читали Кастанеду ‘’Шаманский полет” и прочие его экзерсисы?
Индейцы Толтеки, как, впрочем, и создатели фильма Матрица, считают, что мир в котором мы живем – ни что иное как иллюзия. Человек находится внутри пузыря восприятия и видит окружающий мир как отражение самого себя на стенках этого пузыря. И только избранным, шаманам и Алексею Чекушину ) открыта возможность выходить за рамки оболочки и наблюдать этот мир таким какой он есть.
К чему это я? Да к тому, что кластеризация — это и есть попытка по отражению и ряби на поверхности пузыря восприятия понять, что там снаружи. Но! Есть один пикантный нюанс, реальной картинки как будто бы не существует, как, впрочем, и красной таблетки. 🤯
Задача – изучить 4 способа кластеризации с вариациями:
1 - кластеризация по ТОПу (по Яндексу, по Google, по Ozon, по живой выдаче, по XML, по ТОП-10, по ТОП-20, Soft, Midle, Hard …)
2 - кластеризация по эмбеддингами или векторным представлениям слов (KMeans, Agglomerative Clustering, HDBSCAN, Bayesian Gaussian Mixture и прочие алгоритмы)
3 - кластеризация с помощью LLM моделей (Sonar, Claude Sonnet 4.0, Gemini 2.5 Pro, GPT-5, Grok 3, Perplexity)
4 - кластеризация по Яндекс Веб-мастеру
Цель - найти лучший алгоритм, который, что называется в лоб, покажет лучший результат.
Оценка результата – схожесть с эталонными группировками, которые мне любезно предоставили SEOшники эксперты вампиры верхнего уровня.
Суть эксперимента:
1. Берём запросы, выполняем кластеризацию разными способами
2. Пытаемся найти оптимальный вариант
3. Сравниваем с эталонной выборкой
4. Делаем выводы
На бумаге все выглядит достаточно гладко за исключением пункта №2. Это как раз и есть попытка понять по каким-то метрикам правильно ли мы сгруппировали запросы.
Как это происходит у обычного сеошника?
Взяли запросы сняли топы, покрутили параметры, прикинули на глаз всё ли ок и дальше уже выгружаем все в Excel и начинаем руками перераспределять запросы если нужно. Достаточно муторная работа, требующая реального знания ниши усидчивости и определённых скилов.
Собственно исходя из этой боли и родилась идея. А что, если мы пойдём в учебник по машинному обучению, зададим кучу вопросов в Perplexity или ChatGPT и выведем такую формулу которая позволит нам избегать вот этой вот многочасовой и муторной доводки?
Я так и сделал! Результат тут 😆
Спойлерю - главный вывод, который я сделал в рамках исследования, заключается в том, что не существует идеального метода, позволяющего в лоб с первой итерации достичь приемлемого результата. Поэтому все сказки про некие чудо-инструменты и суперкластеризаторы - это всего лишь рябь на внутренней поверхности пузыря восприятия, не более.
Но, не стоит унывать! На самом деле получились довольно интересные результаты и алгоритм действий, который может приблизить вас к желаемому результату.
Начинаю серии публикаций про такую фундаментальную seoшную процедуру как "кластеризация запросов". Пристегните ремни будет интересно!
Post #164
930

- 💊 7
- 🔥 5
- 👍 3
- ❤ 1