В ролике наш дата-аналитик Николай Курков разбирает кейс, в котором результаты теста выглядели убедительно, но привели команду не к тому выводу.
Проблема оказалась не в цифрах, а в самом подходе к эксперименту. Чтобы такого не происходило, A/B-тест нужно правильно спроектировать ещё до запуска.
Собрали несколько важных пунктов, которые стоит проверить перед стартом и после.
✅ Сразу определите, что именно вы хотите сравнить
До старта зафиксируйте гипотезу, основную метрику и то, как будете её считать.
Для бота результат можно оценивать по пользователям, диалогам или отдельным запросам, и это не одно и то же. Если считать каждый запрос отдельно, человек, который пишет боту сотни раз в день, будет влиять на итог сильнее десятков или даже сотен обычных пользователей.
✅ Сформируйте контрольную и тестовую группы так, чтобы их можно было честно сравнивать
Контрольная группа работает со старой моделью, тестовая — с новой. Важно, чтобы в обеих были похожие пользователи по активности и типу запросов.
Если в тестовую группу случайно попадёт больше активных клиентов, новичков или людей с каким-то специфическим поведением, итог может зависеть именно от состава группы, а не от качества новой модели.
✅ Перед A/B-тестом проверьте, что сами группы не дают разницу
Для этого можно провести A/A-тест, когда двум группам показывают одну и ту же модель и смотрят, насколько похожими получаются результаты.
Если модель одна и та же, а метрики уже заметно отличаются, значит, сначала нужно разобраться с составом групп или способом подсчёта, и только потом сравнивать старую и новую версии.
✅ Даже несколько первых дней часто не дают правильный результат
Заранее определите, сколько будет идти тест и сколько данных нужно собрать.
В начале цифры могут сильно прыгать просто потому, что наблюдений ещё мало. Сегодня новая модель выглядит лучше, завтра хуже, а через несколько дней разница вообще исчезает.
✅ Посмотрите, кто именно повлиял на итог
После теста не ограничивайтесь одной средней метрикой. Проверьте, сколько запросов делали разные пользователи и нет ли среди них нескольких аномально активных.
Если большинство написало боту пару раз, а один пользователь сделал 200 запросов, это важно увидеть отдельно. После этого стоит проверить, сохраняется ли разница между моделями у основной массы пользователей или весь результат держится на нескольких исключениях.
И ещё один уровень проверки можно добавить до выхода на реальную аудиторию. В MWS AI Agents Platform работу агента можно тестировать автоматически: команда заранее задаёт контрольные вопросы и ожидаемые ответы, а платформа прогоняет их и показывает, где агент ошибся и что происходило на каждом этапе.
💬 Узнать подробнее 💬