TGViewer
Data Fusion Data Fusion @data_fusion · 5.38K subscribers
Post #71 1.46K
Сходили (пешком) в гости к YandexGo на TechTalk 🚕

Делимся основными тейками из доклада Дили Хакимовой "Мифы об A/B-тестировании в ML". Поговорили об ошибках первого и второго рода, сложностях бакетной агрегации данных и особенностях данных в сезонном бизнесе. Было много математики и практики — все то, что мы любим 💙

Миф 1. Данные независимы. На самом деле у пользователей повторяются маршруты, время и категория ТС в заказах.
Миф 2. T-тест можно использовать только на нормальных данных. На самом деле даже небольшого количества наблюдений достаточно, чтобы найти асимптоту. ЦПТ в помощь.
Миф 3. T-тест чувствителен к выбросам — убери их, и все будет хорошо. Выбросы могут быть процессом.
Миф 4. Мощность данных в районе 80% — это норм. На самом деле такая мощность в реальных данных встречается редко.
Миф 5. На "серые" метрики не стоит обращать внимания. Они могут быть частью эффекта эксперимента.
Миф 6. U-критерий подходит для проверки равенства средних и медиан. На самом деле проблема критерия Манна-Уитни — он сравнивает распределения, поэтому прокрашивает чаще других критериев и не показывает падение среднего. Для бизнеса игнорировать среднее нельзя.
Миф 7. Если целевая метрика прокрасилась, можно бежать раскатывать фичу. Подглядывая, мы сильно повышаем ошибку первого рода. Находим эффект там, где его нет.
Миф 8. Чем больше метрик проверяется в ходе эксперимента, тем лучше. Нет — метрики не просто могут прокраситься случайно, но они еще и прокрашиваются зависимо друг от друга, и это повышает вероятность ошибки первого рода.
Миф 9. Метрики медиан (квантили) можно считать только бутстрапом. Есть статья, в которой приведены аналитические формулы.
Миф 10. Если выборка маленькая, бутстрап поможет. Базовое предположение бутстрапа, что данные являются хорошим представителем генеральной совокупности.
Миф 11. Для расчета метрик отношения можно перейти к поюзерному отношению. Это неверно: пользователи неравномерно пользуются сервисом, есть heavy-юзеры, есть эпизодические пользователи. Взвесить всех "одинаково" нельзя. Эта метрика может быть не сонаправлена с исходной.

Спасибо команде DS YandexGo за гостеприимство и классный доклад! Тоже ждем вас в гости🔥
  • 🔥 8
  • ❤ 4
  • 💯 4
  • 👍 1
More from @data_fusion
  1. Sep 30, 2026Привет, меня зовут Анна Ширшова, и я с детства занимаюсь театром. А еще руковожу 4-мя кома…
  2. Sep 22, 2026Учить других — и учиться самому: зачем наши DS-ы становятся менторами Алексей Пустынников…
  3. Sep 18, 2026От «магии» к пониманию: знакомим школьников из разных стран с GeoRAG Вчера мы вернулись с…
  4. Sep 16, 2026Post #814
  5. Sep 16, 2026😼Наглядно про CatBoost в новой статье на Хабре Привет! Я Федор Тарасов, занимаюсь машинны…
  6. Sep 11, 2026💡Обзор исследования — «Джейлбрейк ИИ: как взламывают LLM» Сегодня LLM лежат в основе множ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →