🔵 Предлагаю вам взглянуть на пейпер Amazon и Northeastern «Agent A/B: Automated and Scalable A/B Testing on Live Websites with Interactive LLM Agents». Исследование предлагает систему, которая использует LLM-агентов с разными персонажами для автоматизированного и масштабируемого A/B-тестирования веб-интерфейсов — агенты имитируют поведение реальных пользователей (поиск, клики, покупки), что позволяет обойти ограничения традиционных тестов.
Проблема
Авторы сначала опросили шесть практиков из екома, которые регулярно катят тесты на аудитории от миллиона человек. Картина знакомая до боли: путь от идеи до финального решения занимает от трёх месяцев до года, трафика на всех не хватает, тесты на пересекающиеся куски интерфейса приходится ставить в очередь. В итоге до теста доезжает мало гипотез, а ранние прототипы не проверяются никак, кроме как «показали коллегам и спросили, все ли ок».
Что предлагают авторы
Авторы предлагают вставить перед тестом фазу симуляции. LLM генерит 100 000 персон с возрастом, доходом, профессией и привычками в покупках, из них сэмплят 1000 штук и раскидывают 500/500 на контроль и тритмент. Дальше каждый агент через Selenium ходит по живому Amazon.com: ищет, кликает товар, применяет фильтр, покупает или уходит. Страницу парсят не в скриншот и не в сырой HTML, а в урезанный JSON только с товарами, ценами и фильтрами. Сессия обрезается на 20 действиях. Под капотом Claude 3.5 Sonnet.
Тестировали сокращение панели фильтров: в тритменте выбрасывали опции, у которых похожесть на поисковый запрос ниже 80%. Агенты в тритменте купили 414 раз против 403 в контроле, χ²(1)=5.51, p=0.03. Средний чек подрос с $55 до $61, но незначимо. Параллельно тот же тест крутили на 2 млн живых пользователей, и направление эффекта совпало.
Когда это реально нужно
Когда у вас очередь из гипотез и дефицит трафика, а решать, что катить первым, приходится на глазок. Тысяча агентов обошлась в 875 млн токенов и примерно $2900, и это заметно быстрее, чем ждать две недели набора трафика.
От себя
Я придерживаюсь такого мнения, что пока не наступила эпоха AGI и у агентов будет отсутствовать скилл к обобщению, то ценность от симуляционных пользователей низкая и они не заменят живой трафик даже в грубом приближении. Однако, идея использования агентов для приоритезации и чистки бэклога, замер приблизительного импакта и ускорение продуктового груминга выглядит очень даже неплохо.
Trisigma — канал про A/B-тестирование
#trisigma