TGViewer
Data Funk Data Funk @datafunk · 251 subscribers
Post #278 287
И вот лайфхак: ребята из Гарварда предлагают безопасно прикрутить сюда LLM, т.е. смешать реальные данные и синтетические. Самое главное - дают гарантию "это точно не навредит оценке теста" и доказывают, что дисперсия не станет хуже, чем при обычном AIPW. Суть подкупает простой: просим LLM предсказать поведение пользователей в эксперименте, и строим новую оценку эффекта по ее прогнозу. Для каждого пользователя в табличку с наблюдениями теста добавляется две колонки:
S - оценка эффекта, посчитанная через стандартную ML-модель.
L - оценка эффекта, посчитанная через LLM. Ищем их комбинацию Final = λ*S + (1-λ)*L, чтобы дисперсия была минимальная: λ = (Var(L) - Cov(S,L)) / (Var(S) + Var(L) - 2*Cov(S,L)).

По этой же схеме можно смешать сразу несколько LLM. Если ответы галлюцинируют, то алгоритм просто обнуляет их веса и возвращается к базовому AIPW. Главное выбрать что дешевле: прогонять тысячи юзеров через LLM API или набрать больше людей в тест.
  • ✍ 4
More from @datafunk
  1. Sep 14, 2026Post #293
  2. Sep 6, 2026Post #292
  3. Jul 10, 2026Команда из École Normale Supérieure (🇫🇷) собрала CalArena - один из самых больших бенчма…
  4. Jun 17, 2026Листаю статьи про A/B и ML, и это будто две разные вселенные. Только в Causal ML они хоть…
  5. Jun 7, 2026Что по плюсам: Скорость: Это в разы быстрее любых других методов. Строгость: На руках чест…
  6. Jun 7, 2026В прошлом году открыл статью, пробежался по диагонали и закрыл. А недавно увидел ее снова…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →