TGViewer
Персонализация неизбежна Персонализация неизбежна @recsys_for_all · 1.32K subscribers
Post #21 3.59K
Про "рекомендательные системы" скидок, бонусов, тритментов и пр.

Все посты до этого были про персонализацию на больших каталогах (когда айтемов много). Но есть задачи по персонализации некоторых "стратегий" (или тритментов), в которых может быть очень много бизнес-профита (советую посмотреть статьи D. Goldenberg из Booking на RecSys 20/22 и др.).

Например, вам могут принести задачу: "построить рекомендательную систему скидок в такси, чтобы она рекомендовала, какую скидку дать конкретному клиенту". Тут можно спорить о терминах — рек. система это или нет, — но персонализация явно может помочь.

Датасет будет примерно такой:
user_id, treatment_group (0%, 5%, 10% скидки), date, target

Я сталкивался с 4 разными прикладными задачами из разных доменов, которые подходят под это условие. И можно было бы сэкономить много времени, если бы знал следующее: делать что-то хорошее можно только на рандомизированной раздаче тритментов (то есть вы сначала делаете рандомную раздачу, и поверх нее только обучаете модель). И вот почему:

1. Это важно для обучения модели. Если большую скидку давать тем, кто вряд ли закажет, а маленькую — тем, кто пользуется постоянно, то модель выучит контринтуитивную связь:
Чем больше скидка, тем меньше вероятность, что человек купит → значит, всем надо дать маленькую скидку.

Когда же тритменты назначаются случайно, появляется шанс выучить что-то адекватное.

2. Это важно для валидации модели. Задачи часто связаны с финансами, и очень важно корректно оценить стратегию по эффективности. Когда-то я долго гуглил тему "evaluation of multiple treatments" и нашел вот такую статью. Я показал её коллеге Вите Харламову (@xapulc) и очень удивился, когда через пару дней Витя прислал ~5 страниц математического текста с доказательством корректности метода при определённых условиях. Потом узнал, что Витя учится в аспирантуре ММ МГУ :) Вот ссылка на его пост, где он рассказывает про метод и в целом обещал продолжить писать на тему персонализации.

Но иметь рандомизированную выборку дорого — её надо постоянно поддерживать для обновления модели; больший размер = меньше эффект от персонализации и т. д. Поэтому хочется использовать смещённые данные (а) для обучения и (б) для валидации.

Сейчас думаю так: для обучения можно пробовать разные методы "устойчивые к смещению" (они легко гуглятся) — например, аккуратно добавлять смещённую часть данных к рандомной. Но вот валидацию моделей, насколько я знаю, можно делать только на чистом рандомном эксперименте. Если вы знаете другие способы — пишите в комментариях 👇
Telegram Math for Impact Оценка качества персонализации TL;DR Позволяет оценить эффективность персонализации без проведения нового эксперимента. Особенно полезен, если вариантов воздействий немного. Почему обсуждается? При разработке персонализации важно заранее понимать, принесёт…
  • 🔥 23
  • 🏆 6
  • 🤩 5
  • ❤ 2
More from @recsys_for_all
  1. Aug 11, 20263 CIKM short papers + 2 RecSys demos 🎉 и немного новостей русскоязычного RecSys Последние…
  2. Jul 10, 2026+1 short paper на RecSys 2026! Давно ничего не писал, но наконец-то появился хороший повод…
  3. Jan 24, 2026Моё решение — 5/216 место на VK RecSys Challenge LSVD Мне было интересно снова поучаствова…
  4. Dec 30, 2025Итоги 2025 года. Ровно год назад я сделал 9 предположений о том, что произойдет в мире рек…
  5. Nov 17, 2025🎯 T-Meetup: RecSys — 27 ноября, 19:00, Санкт-Петербург Открыли регистрацию на наш митап п…
  6. Jul 20, 2025Про мой доклад на Turbo ML Conf 2025 Вчера выступил на конференции Т-Банка. Рассказал о то…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →