Аналитику нужно знать нейросети?
Всем привет!🤟
Давайте поразмышляем. Уже, наверное, ни для кого не секрет, что на собеседованиях на продуктового аналитика во многих компаниях спрашивают базовые вопросы по классическому машинному обучению. Но часто ли МЛ действительно нужен в работе? На самом деле — да. Зачастую, чтобы выцепить важные инсайты из данных, простого визуального или базового статистического анализа бывает недостаточно. Поэтому в арсенале аналитика должны быть базовые методы машинного обучения и понимание того, какие ограничения есть у той или иной модели в конкретном кейсе.
А что с нейросетями? Сразу вас обрадую — их на собеседованиях почти не спрашивают. Но знание базовых подходов (например, word2vec, doc2vec) сильно расширяет горизонты при решении задач.
Ранее я рассказывал про базовый метод борьбы с сетевыми эффектами — кластерные А/B-тесты (или рег. тесты). Их суть в том, чтобы хорошо подобрать кластеры, внутри которых клиенты действительно влияют друг на друга. Но как их подобрать? Можно использовать бизнес-интуицию, можно — K-means или другие классические алгоритмы. Однако у большинства таких методов жёсткие предположения, которые в итоге снижают чувствительность А/B-теста: они «захватывают» лишних, шумовых клиентов, которые на самом деле никак не взаимодействуют между собой.
И вот здесь могут помочь методы, учитывающие контекст взаимодействия. Представьте: вам нужно измерить эффект нового алгоритма поиска. Логично объединять в кластеры те item_id, которые часто встречаются рядом друг с другом в поисковых сессиях (просмотрах). Но как это увидеть? Посчитать все возможные пары по встречаемости item_id? Попробуйте хотя бы мысленно оценить, сколько уникальных пар существует в «мешке» из 10 000 позиций :) Очевидно, что такой подход не масштабируется.
В итоге мы приходим к тому, что в таких задачах можно и нужно применять инструменты NLP, которые как раз умеют учитывать контекст совместной встречаемости объектов — то же самое, что делают коллеги из Airbnb, обучая word2vec для получения эмбеддингов для item_id.
Буквально пару дней назад я задумался над похожей задачей при попытке улучшить текущую модель кластеризации клиентов в Х5. В текущей реализации у нас нет возможности учитывать тонкости покупательского поведения. Я наткнулся на очень крутую статью, в которой подробно рассказывается, как можно подойти к этой задаче через использование word2vec или doc2vec при построении эмбеддингов клиентов (customer_rk).
Советую Вам в дороге на работу или за обедом прочитать её и переосмыслить, как можно улучшить ваши текущие подходы — в A/B-тестировании, в кластеризациях, в uplift-моделях и вообще в понимании клиентов, потому что она написана очень доступным языком, с примерами с кодом и описан бизнес-контекст всего происходящего!
Всем суперских выходных! Спасибо Вам, что читаете мои посты и ставите реакции✈️
Post #42
2.24K
- 👍 21
- 🔥 13
- ⚡ 7
- ❤ 4
- 🤔 2
- 🐳 1
- 🆒 1