TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.69K subscribers
Post #66 1.82K
Экстраординарные утверждения требуют экстраординарных доказательств

Продолжаем разговор про RL-рекомендации, начавшийся тут.

Чтобы доказать, что RL-алгоритм выполняет поставленную задачу - максимизирует ту награду, которую мы задаём в процессе обучения, нужно проводить аккуратный ablation study.

Что я хочу в нём увидеть?

В RL есть параметр Gamma, отвечающий за горизонт планирования. Если он равен 1, то это значит, что мы максимизируем всю будущую награду, а если 0, то только ближайшую - это по сути как в Supervised learning. Обычно в обучении используют гамму, близкую к 1, но итоговый результат измеряют с помощью награды, просуммированной на всём промежутке (то есть как будто Gamma = 1).

Я хотел бы, чтобы авторы обучали и тестировали дополнительную версию своей модели с единственным изменением - с Gamma, равной 0. Это лучший способ доказать, что учитывание последующих наград действительно приносит пользу и использование RL имеет смысл.

Кроме того, важным бейзлайном может быть модель, которая учитывает долгосрочные награды, но только связанные только с совершённым действием напрямую. Например, мы берём порекомендованный товар и учитываем все его покупки в будущем, которые были совершены, в качестве таргета. Это проверяет предположение о том, что можно обойтись аккуратным расчётом таргета для классического рекомендательного алгоритма, а не мучиться с RL.

Я не помню, когда последний раз видел подобное аккуратное сравнение, если видел вообще. В подавляющем количестве работ RL-алгоритм сравнивается с алгоритмом, который отличается в 10 местах, и из этого сравнения невозможно сделать качественный вывод о том, что влияет на результат.

@knowledge_accumulator
  • 👍 24
  • 🔥 4
  • 😁 2
  • 🤔 2
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →