И он немного ломает популярную идею, что в больших продуктах обычные A/B-тесты уже вот-вот заменят AI.
Как всё устроено
Spotify специально разделяет две системы:
1. ML-платформа рекомендаций решает, что конкретно показать конкретному человеку.
2. Experimentation-платформа проверяет, создаёт ли вся эта персонализация дополнительную ценность.
В ML-платформе работают контекстные многорукие бандиты, которые могут выбирать лучший вариант отдельно для каждого пользователя: одному показать рэп, другому подкаст, а третьему новый релиз любимого артиста.
При этом Spotify не считает такую платформу системой экспериментов. Для них это просто ещё одна продуктовая фича, которую потом всё равно нужно положить в обычный A/B-тест и сравнить с предыдущей версией рекомендаций.
По итогу персонализация выбирает лучший вариант внутри системы. A/B-тест проверяет, лучше ли сама система.
❓ Логичный вопрос: зачем лишний A/B-тест? Почему просто не довериться алгоритму?
Допустим, новый алгоритм мгновенно увеличил время прослушивания. Проблема в том, что его легко увеличить, бесконечно подсовывая человеку знакомые песни, которые он уже любит.
В моменте всё отлично: меньше скипов, больше минут, выше CTR рекомендаций. Но человек перестаёт открывать новую музыку, а огромный каталог фактически схлопывается до нескольких любимых артистов. Через какое-то время может пострадать и долгосрочное удовлетворение продуктом.
❓ Второй логичный вопрос: почему нельзя сделать суперумный алгоритм персонализации и засунуть в него все глобальные метрики?
Тогда в теории можно всех уволить, а AI будет сам растить продукт. И как будто теоретически можно. В некоторых компаниях именно так и пытаются делать.
Можно сказать алгоритму: максимизируй listening time, discovery, diversity и retention. При этом не увеличивай скипы и не сокращай потребление новых артистов.
Но дальше возникает несколько фундаментальных проблем.
1️⃣ Все бизнес-решения нужно превратить в одну формулу
Любому бандиту обычно нужна одна reward-функция. Например:
Reward = listening time + discovery + retention − skips
Но как в ней определить пропорции? Одна найденная песня равна пяти минутам прослушивания? Рост retention на 0,1% стоит падения listening time на 1%? Можно ли ухудшить опыт небольшой аудитории ради среднего роста?
Для сотен продуктовых команд такая система быстро становится слишком сложной и плохо управляемой.
2️⃣ Важные эффекты проявляются слишком поздно
Retention можно нормально оценить только через несколько недель.
Алгоритм сегодня получил положительный сигнал, а через месяц выяснилось, что его решения ухудшили музыкальные привычки и человек начал реже открывать продукт. Но к этому моменту неправильная стратегия уже могла закрепиться на миллионах последующих решений.
3️⃣ Персонализация создаёт feedback loop
Алгоритм решил, что ты любишь рэп → начал показывать больше рэпа → ты чаще его слушаешь, потому что другого почти не показывают → алгоритм получает подтверждение → показывает ещё больше рэпа.
Система может решить, что отлично персонализирует продукт, хотя на самом деле сама постепенно сузила твой выбор.
Независимый A/B-тест позволяет увидеть, не создаёт ли новая система такие долгосрочные петли.
Короче
Относитель легко построить систему, которая быстро находит локальный максимум по одной метрике. Но понять, является ли этот максимум хорошим для бизнеса и пользователя через несколько месяцев сильно сложнее.
Поэтому конкретно в Spotify тысячу простых и понятных экспериментов пока не заменили одним теоретически идеальным AI-инструментом, которым никто, кроме нескольких data scientists, нормально пользоваться не умеет.
Пока живём, кожаные!