Выходные прошли и провёл я их в мыслях: а куда вообще движутся рекомендательные системы? Не в смысле "какой следующий датасет выкатят или какую новую модель", а концептуально что они пытаются сделать с человеком?
Да и такое бывает, люблю рефлексировать)
И понял, что меня давно подбешивает одна штука.
Почти все системы решают одну задачу: угадать, на что ты кликнешь прямо сейчас. Ну или максимум что досмотришь до конца. Это оптимизация под сиюминутное попадание.
Любишь фантастику, вот тебе ещё фантастика. Слушаешь lo-fi держи ещё lo-fi. И так бесконечно.
И круг потихоньку сжимается вокруг тебя, пока не начнёшь чувствовать себя в пузыре бесконечно одинаковых рекомендаций.
Но что если поменять сам вопрос?
Не "чего пользователь хочет сейчас", а "какая последовательность рекомендаций сделает его вкус богаче через месяц".
Прикол в том, что вкусы меняются.
У каждого из нас не один вкусовой вектор, а целых три:
- ядро: то, что мы стабильно любим
- то, к чему мы почти готовы, но ещё не дошли или не созрели
- зона отторжения: то, что сейчас точно не зайдёт
Обычные системы крутятся внутри ядра. А реально интересно работать во второй зоне, искать мостики к новым объектам: достаточно знакомые, чтобы не оттолкнуть, и достаточно новые, чтобы принести пользу.
Да, вы можете сказать: ну камон, есть же диверсификация или серендипити, но это всё свойства списка, а я больше про модель изменения вкусов пользователя во времени.
Если система просто берёт топ-100 релевантных, добавляет штраф за похожесть, иногда домешивает неожиданный item, то это старый рекомендер с умным реранкером.
Но, если продолжить идею: если система оценивает текущую "готовность к переходу", выбирает промежуточные объекты, планирует серию шагов, измеряет успех как появление нового устойчивого интереса, то это уже не диверсификация, а обучаемая траектория с графами вкусовых зон пользователя.
Это меняет саму целевую функцию. Вместо привычного score(user, item) оптимизируешь что-то вроде:
Скор = Польза_сейчас + Полезное_удивление + Расширение_вкуса − Сожаление
И тут не ранжирование как таковое, а ближе к управлению динамической системой вкуса пользователя.
Главная боль: долгосрочные сигналы собирать сложно. И легко переумничать ведь система начнёт слишком рьяно "развивать" пользователя и просто его задолбает.
Но именно поэтому мне кажется, что здесь есть пространство для оптимизаций и расширения, туда куда могут пойти рек системы.
Рекомендательная система должна не угадывать, что ты уже любишь, а помогать тебе полюбить то, до чего ты почти дорос.
Если кто-то знает людей или команды, которые серьёзно копают в эту сторону киньте в комменты, очень интересно почитать 🙏
А если нет - вызов принят 😂