Готовлюсь сейчас к выступлению – тема не новая, но вечная: методы ускорения экспериментов.
Один из них – CUPED. Кажется, только ленивый про него не читал, большинство так или иначе пробовали руками.
Если брать CUPED в базовом виде – по оригинальной статье – одна из ключевых настроек это окно ковариаты: какой ретро-период брать. Влияние на чувствительность очевидно и легко проверяется симуляциями.
Но есть момент, который проверяют куда реже – сонаправленность эффектов до и после CUPED.
Можно так увлечься оптимизацией окна, что lift метрики без CUPED и lift с CUPED начнут расходиться по знаку. И тогда теряется интерпретируемость – а вместе с ней и практическая применимость метода.
Sign consistency – вероятность того, что raw-оценка эффекта и adjusted-оценка имеют одинаковый знак. Формально: если обе положительные или обе отрицательные – эффект сонаправлен.
Если знаки разные – CUPED просто испортил вашу метрику, а если вы этого не заметили, то и эксперимент или эксперименты убили.
Как быстрый вывод – проверяйте!
Базовый CUPED – линейная регрессия одной ковариаты на метрику. Простота – его сила. Но за 10+ лет накопилось несколько направлений развития.
1. Множественные ковариаты – MLR-CUPED Вместо одной переменной – несколько: активность за разные периоды, сегмент пользователя, платформа. Помогает, когда одна ковариата объясняет только часть дисперсии. Риск – переобучение и нестабильность коэффициентов на малых выборках. Но значительно меньше проблем со направленностью
2. Нелинейные ковариаты – ML-CUPED Линейная связь между ковариатой и метрикой – упрощение. В реальности зависимость часто нелинейная. Подход: обучить модель (градиентный бустинг, нейросеть) предсказывать метрику по ковариатам, использовать остатки как скорректированную метрику. Оптимизация чувствительности выше, но интерпретируемость падает – и проблема сонаправленности становится еще критичнее.
Канал «Телекомпания Вит»
Post #83
410

- ❤ 5
- 🔥 5