TGViewer
MWS AI MWS AI @mtsai · 7.16K subscribers
Post #1704 612
Когда хорошая метрика приводит к плохому решению? 🔍

В ролике наш дата-аналитик Николай Курков разбирает кейс, в котором результаты теста выглядели убедительно, но привели команду не к тому выводу.

Проблема оказалась не в цифрах, а в самом подходе к эксперименту. Чтобы такого не происходило, A/B-тест нужно правильно спроектировать ещё до запуска.

Собрали несколько важных пунктов, которые стоит проверить перед стартом и после.

Сразу определите, что именно вы хотите сравнить
До старта зафиксируйте гипотезу, основную метрику и то, как будете её считать.

Для бота результат можно оценивать по пользователям, диалогам или отдельным запросам, и это не одно и то же. Если считать каждый запрос отдельно, человек, который пишет боту сотни раз в день, будет влиять на итог сильнее десятков или даже сотен обычных пользователей.


Сформируйте контрольную и тестовую группы так, чтобы их можно было честно сравнивать
Контрольная группа работает со старой моделью, тестовая — с новой. Важно, чтобы в обеих были похожие пользователи по активности и типу запросов.

Если в тестовую группу случайно попадёт больше активных клиентов, новичков или людей с каким-то специфическим поведением, итог может зависеть именно от состава группы, а не от качества новой модели.


Перед A/B-тестом проверьте, что сами группы не дают разницу
Для этого можно провести A/A-тест, когда двум группам показывают одну и ту же модель и смотрят, насколько похожими получаются результаты.

Если модель одна и та же, а метрики уже заметно отличаются, значит, сначала нужно разобраться с составом групп или способом подсчёта, и только потом сравнивать старую и новую версии.


Даже несколько первых дней часто не дают правильный результат
Заранее определите, сколько будет идти тест и сколько данных нужно собрать.

В начале цифры могут сильно прыгать просто потому, что наблюдений ещё мало. Сегодня новая модель выглядит лучше, завтра хуже, а через несколько дней разница вообще исчезает.


Посмотрите, кто именно повлиял на итог
После теста не ограничивайтесь одной средней метрикой. Проверьте, сколько запросов делали разные пользователи и нет ли среди них нескольких аномально активных.

Если большинство написало боту пару раз, а один пользователь сделал 200 запросов, это важно увидеть отдельно. После этого стоит проверить, сохраняется ли разница между моделями у основной массы пользователей или весь результат держится на нескольких исключениях.


И ещё один уровень проверки можно добавить до выхода на реальную аудиторию. В MWS AI Agents Platform работу агента можно тестировать автоматически: команда заранее задаёт контрольные вопросы и ожидаемые ответы, а платформа прогоняет их и показывает, где агент ошибся и что происходило на каждом этапе.

💬 Узнать подробнее 💬
More from @mtsai
  1. Sep 22, 2026Бот закрыл диалог, а клиент снова звонит. Что может быть не так с автоматизацией поддержки…
  2. Sep 17, 2026ИИ-агент сам напишет код и запустит работу по расписанию 🤖 Обновили MWS AI Agents Platfor…
  3. Sep 14, 2026Post #1703
  4. Sep 14, 2026Сколько времени закладывать на найм AI-команды? Сегодня поиск ML-инженера занимает в средн…
  5. Sep 10, 2026Кажется, ваши агенты хотят в песочницу 👀 Когда агенту нужно не просто ответить, а обработ…
  6. Sep 9, 2026🤖 Новый выпуск подкаста «По проводам» 🤖 В этот раз поговорили с Александром Лукьяновым,…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →