Кластеризация – эксперименты и выводы, продолжение
Пример сложной тематики №2 - кредиты, эталонная выборка – 1490 ключей, 143 кластера, 24 алгоритма для исследования
Лучшие результаты кластеризации:
По ТОП-20 XML Яндексу по сайту banki.ru (middle)
По ТОП-20 Google по сайту banki.ru (middle)
По ТОП-20 XML Яндексу (middle)
По ТОП-20 Google по (\ middle)
Худшие результаты кластеризации:
Perplexity в режиме research
По ТОП-20 Google (soft)
По ТОП-20 Yandex (soft)
Дальше приводить результаты экспериментов не вижу смысла, поскольку спустя почти 2 месяца проб, ошибок и выгорания я смог сделать определенные выводы и давайте я вас с ними познакомлю.
Выводы из экспериментов
1) Софт не имеет значения, все они делают одно и то же, снимают ТОПы по запросам и находят пересечения. Я в исследовании использовал keyassort и собственный кластеризатор на Python, результаты идентичны.
2) XML и Live выдача в Яндексе – не увидел принципиальной разницы. XML работает стабильней и быстрее, поэтому нет смысла заморачиваться.
3) Лучший агрегатор XML для массовых проверок - https://xmlstock.com/, работает стабильнее чем River плюс поддерживает больше потоков
4) Как это не удивительно, но я не увидел большой разницы в оценках между Яндекс и Google. Честно говоря, ожидал большего разброса, но результаты схожи.
5) На схожесть результатов сильно влияет разброс ядра. Чем оно разнообразнее, тем лучше результаты.
6) Нейросети (LLM) пока рано использовать, слишком большой разброс и нестабильный результат.
7) Хорошо, когда в нише есть безоговорочный лидер, например exist.ru в автозапчастях. Зачастую кластеризация по сайту лидеру дает лучший процент схожести с эталонной выборкой. Ну и кто возразит, что banki.ru – у нас явный и многолетний лидер?
8) Кластеризация по жестким условиям – плохой результат, например по Хард алгоритму по ТОП-10 с порогом схожести 4 и выше
9) Кластеризация по Яндекс Вебмастеру – сложно, долго. ЯВМ больше под сбор семантики чем под кластеризацию
10) Кластеризация по эмбеддингам - хорошо отрабатывает на больших разнородных ядрах. Причем сами эмбеддинги стоят копейки. Я в общей сложности просмотрел порядка 500 к запросов и потратил на это не более 70 р. Да для сложных тематик эмбеддинги не подходят, но для тех же самых автозапчастей разобрать пару миллионов запросов - легко! Вы на таких объемах запаритесь ТОПы снимать.
Ну и возможно самый главный вывод: Кластеризация в Яндексе – напрямую коррелирует с ПФ вашей страницы. Чем лучше ПФ, тем больше он вам докидывает запросов. И то, что вы кластеризуете сейчас – это некая средняя температура по больнице. Если вдруг, ваш сайт окажется лучшим в ТОПе по ПФ, то с высокой степенью вероятности первоначальная кластеризация, которую вы делали по ТОПам или по Лидерам – сломается.
Я двигаю пару проектов в нише агрегаторов GPT и прочих нейросетей и могу сказать, что есть пара сайтов находящихся в ТОПе почти без вхождений, но поскольку там сумасшедшие ПФ за счет бесплатно представляемой услуги – они показываются по очень широкому ядру запросов!
Роадмап
1) Снимаете ТОПы
2) Кластеризуете по несильно жестким условиям, выявляете лидеров
3) Крутите коэффициенты
4) Сравниваете с лидерами
5) Смотрите корреляцию по сайтам из ТОПов по Яндекс Вебмастеру.
Что делать после кластеризации? Внедрять в различные зоны документов, не забывайте при этом про n-граммы и LSI термины. Боты в помощь!
Post #169
1.86K




- 👏 13
- 👍 8
- ❤ 4
- 🆒 1
- 💊 1