TGViewer
Trisigma — про эксперименты Trisigma — про эксперименты @trisigma_avito · 7.25K subscribers
Post #250 2.03K
Всем привет, это Искандер

🔵 Предлагаю вам взглянуть на пейпер Amazon и Northeastern «Agent A/B: Automated and Scalable A/B Testing on Live Websites with Interactive LLM Agents». Исследование предлагает систему, которая использует LLM-агентов с разными персонажами для автоматизированного и масштабируемого A/B-тестирования веб-интерфейсов — агенты имитируют поведение реальных пользователей (поиск, клики, покупки), что позволяет обойти ограничения традиционных тестов.

Проблема

Авторы сначала опросили шесть практиков из екома, которые регулярно катят тесты на аудитории от миллиона человек. Картина знакомая до боли: путь от идеи до финального решения занимает от трёх месяцев до года, трафика на всех не хватает, тесты на пересекающиеся куски интерфейса приходится ставить в очередь. В итоге до теста доезжает мало гипотез, а ранние прототипы не проверяются никак, кроме как «показали коллегам и спросили, все ли ок».

Что предлагают авторы

Авторы предлагают вставить перед тестом фазу симуляции. LLM генерит 100 000 персон с возрастом, доходом, профессией и привычками в покупках, из них сэмплят 1000 штук и раскидывают 500/500 на контроль и тритмент. Дальше каждый агент через Selenium ходит по живому Amazon.com: ищет, кликает товар, применяет фильтр, покупает или уходит. Страницу парсят не в скриншот и не в сырой HTML, а в урезанный JSON только с товарами, ценами и фильтрами. Сессия обрезается на 20 действиях. Под капотом Claude 3.5 Sonnet.

Тестировали сокращение панели фильтров: в тритменте выбрасывали опции, у которых похожесть на поисковый запрос ниже 80%. Агенты в тритменте купили 414 раз против 403 в контроле, χ²(1)=5.51, p=0.03. Средний чек подрос с $55 до $61, но незначимо. Параллельно тот же тест крутили на 2 млн живых пользователей, и направление эффекта совпало.

Когда это реально нужно

Когда у вас очередь из гипотез и дефицит трафика, а решать, что катить первым, приходится на глазок. Тысяча агентов обошлась в 875 млн токенов и примерно $2900, и это заметно быстрее, чем ждать две недели набора трафика.

От себя

Я придерживаюсь такого мнения, что пока не наступила эпоха AGI и у агентов будет отсутствовать скилл к обобщению, то ценность от симуляционных пользователей низкая и они не заменят живой трафик даже в грубом приближении. Однако, идея использования агентов для приоритезации и чистки бэклога, замер приблизительного импакта и ускорение продуктового груминга выглядит очень даже неплохо.




Trisigma — канал про A/B-тестирование

#trisigma
  • ❤ 10
  • 🔥 5
  • 👍 3
  • 👎 3
More from @trisigma_avito
  1. Sep 14, 2026Привет! Это Вит. 1 октября мы проведём первый митап в Ташкенте — Trisigma to Tashkent. Это…
  2. Aug 27, 2026Всем привет! На связи Вит и это пост по следам вчерашней FuckUp Night. 🔵 Вчера мы собрали…
  3. Aug 26, 2026Привет! Сегодня встречаемся на FuckUp Night в 18:00 по Москве. Записи не будет, поэтому жд…
  4. Aug 12, 2026Привет! Это Вит. Мы с Романом Нестером, Валерием Бабушкиным и Бесланом Курашовым (plevako.…
  5. Jul 30, 2026Привет! Это Вит. Выпустили на Хабре AvitoTech короткое интервью. Короткое, потому что это…
  6. Jul 28, 2026Всем привет, это Искандер. 🔵 Предлагаю вам взглянуть на пейпер Airbnb про interleaving. П…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →