Канал от практиков в Data Science для тех, кто хочет доводить свои модели до продакшена.
Ведёт команда Симулейтив: @simulative_official
Post #32
192

Как понять, что на самом деле означают кластеры?
Привет! На связи Мария Жарова, ментор курсов «Инженер машинного обучения» и «Дата-сайентист» 👋🏻
Кластеризация — классная штука: модель сама разбивает объекты на группы, и никакая разметка не обязательна. Но проблемы обычно начинаются потом — когда необходимо понять, что вообще означают эти кластеры?
Дело в том, что просто получить лейблы модели недостаточно: если вы не интерпретировали кластеры, ценность такого решения стремится к нулю.
Держите два простых и очень наглядных способа, которые быстро помогают «прочитать» кластеры 👇
1️⃣ Тепловая карта (heatmap)
Идея — берём признаки и считаем их средние значения внутри каждого кластера и дальше строим heatmap:
➖ по строкам — кластеры;
➖ по столбцам — признаки;
➖ цвет — значение.
Таким образом, вы сразу видите профиль кластера — где значения высокие, где низкие, и какие признаки «определяющие» для каждого кластера.
📌 В plotly можно использовать
2️⃣ Полярная диаграмма (Radar Chart)
Это уже более продвинутый способ: берём те же средние значения признаков и откладываем их по осям в виде «паутины». Таким образом, каждый кластер представляет собой отдельный многоугольник.
Что здесь удобно:
➖ Легко сравнивать кластеры между собой;
➖ Сразу видно, по каким признакам кластер «выделяется»;
➖ Отлично заходит для презентаций.
📌 В plotly можно использовать
Зачем это нужно?
Кластеризация — это больше не про алгоритм, а про смысл результатов. Если вы не можете объяснить, по какому принципу в каждой кластере собраны объекты, задача решена не до конца и приносить пользу бизнесу она не сможет.
Поэтому после ML-ной части с экспериментами и метриками не забывайте о простой, но самой важной части — интерпретации 😉
Сохраняйте — пригодится в реальных задачах!
Привет! На связи Мария Жарова, ментор курсов «Инженер машинного обучения» и «Дата-сайентист» 👋🏻
Кластеризация — классная штука: модель сама разбивает объекты на группы, и никакая разметка не обязательна. Но проблемы обычно начинаются потом — когда необходимо понять, что вообще означают эти кластеры?
Дело в том, что просто получить лейблы модели недостаточно: если вы не интерпретировали кластеры, ценность такого решения стремится к нулю.
Держите два простых и очень наглядных способа, которые быстро помогают «прочитать» кластеры 👇
1️⃣ Тепловая карта (heatmap)
Идея — берём признаки и считаем их средние значения внутри каждого кластера и дальше строим heatmap:
➖ по строкам — кластеры;
➖ по столбцам — признаки;
➖ цвет — значение.
Таким образом, вы сразу видите профиль кластера — где значения высокие, где низкие, и какие признаки «определяющие» для каждого кластера.
📌 В plotly можно использовать
px.imshow или go.Heatmap2️⃣ Полярная диаграмма (Radar Chart)
Это уже более продвинутый способ: берём те же средние значения признаков и откладываем их по осям в виде «паутины». Таким образом, каждый кластер представляет собой отдельный многоугольник.
Что здесь удобно:
➖ Легко сравнивать кластеры между собой;
➖ Сразу видно, по каким признакам кластер «выделяется»;
➖ Отлично заходит для презентаций.
📌 В plotly можно использовать
go.ScatterpolarЗачем это нужно?
Кластеризация — это больше не про алгоритм, а про смысл результатов. Если вы не можете объяснить, по какому принципу в каждой кластере собраны объекты, задача решена не до конца и приносить пользу бизнесу она не сможет.
Поэтому после ML-ной части с экспериментами и метриками не забывайте о простой, но самой важной части — интерпретации 😉
Сохраняйте — пригодится в реальных задачах!
- 🔥 5
- ❤ 4
- 👍 4















