TGViewer
Не AI Заметки AI Менеджера Не AI Заметки AI Менеджера @not_ai_manager_notes · 351 subscribers
Post #10 519
⚡️ Укорачивай цикл. Чем быстрее гипотеза проверится на пользователях, тем меньше шанс, что за это время изменятся сами пользователи или контент. Минимизируйте задержку между оффлайн-экспериментом и онлайн-тестом. Один из подходов – off-policy оценка новых моделей: методы типа Inverse Propensity Scoring или Doubly Robust позволяют прикинуть эффект модели на основе собранных логов, без мгновенного выпуска в продакшен. Это активно исследуется и даёт возможность оценивать ранжирующие алгоритмы по логам с приемлемой точностью. Да, приходится вводить допущения и бороться с дисперсией оценок, но для некоторых задач (например, рекомендаций с явным фидбеком) это работает. А в онлайне для ускорения итераций можно вместо классического 50/50 A/B-теста использовать метод многорукого бандита (Bandit) – динамически перераспределяя трафик к лучшему варианту. Если риск от неудачного варианта невелик, бандиты позволяют быстрее подтвердить преимущество новой модели.

📊 Копи и анализируй эксперименты. Не пренебрегайте кропотливым сбором статистики по множеству запусков. Со временем можно выявить, какие именно оффлайн-метрики хоть как-то предсказывают успех по ключевой онлайн-метрике в вашем продукте. Иногда это не одна метрика, а комбинация показателей. Например, на платформе OTTO (крупный европейский e-commerce) провели масштабный эксперимент: одновременно протестировали группы рекомендаций, оптимизированные под разные оффлайн-метрики, и потом замерили их онлайн-результаты. Итогом стала идентификация стабильных соответствий между определёнными оффлайн метриками и реальными метриками кликов и конверсий пользователей. Проще говоря, удалось найти наборы оффлайн-метрик, рост которых практически гарантирует улучшение CTR и Post-Click конверсии онлайн – ценнейшая информация для команды.

🤖 Построй мета-модель. Если у вас накопилось достаточно данных по прошлым экспериментам, можно попробовать обучить простую модель или вывести эвристику, которая будет предсказывать шанс успеха нового алгоритма. Идея в том, чтобы по fingerprint оффлайн-результатов (например, разнице в precision, diversity, novelty по сравнению с текущим продакшеном) прикидывать, “выстрелит” ли модель онлайн. Такой себе внутренний оракул: «Если оффлайн precision вырос на +5%, новизна упала на -2%, а покрытие увеличилось на +10%, то вероятность выигрыша по CTR ~80%». В индустрии рассказывают, что подобные мета-модели помогают фильтровать заведомо бесперспективные запуски.

💬 Мой опыт
В Booking.com проблему разрыва метрик пытались решить системно: построили платформу для экспериментов, где каждый запуск логировался и сохранялся в MLflow. Для каждой модели хранились все рассчитанные оффлайн-метрики, а после A/B-теста туда же добавлялся результат онлайн. Со временем накопился датасет экспериментов, из которого стало понятно, какие алгоритмы переобучаются (оффлайн хорошие метрики, но стабильно “красные” тесты), а какие действительно дают прирост. Во многом благодаря этому мы начали доверять некоторым оффлайн-показателям и ускорили цикл разработки.
В другой компании мы даже пробовали собрать небольшой мета-ранкер на базе прошлых запусков. Он оценивал новую модель по совокупности характеристик (метрики точности, разнообразия, новизны и т.п. относительно текущей версии) и выдавал score приоритетности для онлайна. Конечно, это не заменяет живой A/B, но как дополнительный сигнал – весьма полезно, особенно когда ресурсов на эксперименты ограничено.

📎 Материалы, которые советую:
- Identifying Offline Metrics that Predict Online Impact (RecSys 2025)

- Handling Online-Offline Discrepancy in Ads Ranking (Pinterest Engineering)

- Offline vs online vs business metrics

- Doubly Robust Off-Policy Evaluation

- Валидация в RecSys для корреляции в А/Б

- Mastering Recommendation Systems Evaluation: An A/B Testing Approach with Insights from the Industry
  • 🔥 13
  • ❤ 2
More from @not_ai_manager_notes
  1. Jun 20, 2026📉МЛ, который тихо вредит бизнесу Давно не было постов — надо исправляться. Начну с истори…
  2. Apr 1, 2026Как подготовиться к behavioral interview? Так получилось, что последние пару лет я активно…
  3. Mar 14, 2026Rectools - фреймворк для рекомендательных систем. В сентябре 2025 года Rectools была предс…
  4. Feb 5, 2026Performance review (PSC) в BigTech для ML-инженеров По нашумевшим новостям про изменения P…
  5. Feb 4, 2026LLM basic overview Недавно собирал полезные ссылки для подготовки к верхнеуровневому собес…
  6. Dec 29, 2025Собеседования на менеджерские/руководящие роли в AI/ML/DS/Engineering/Applied Science. Так…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →