TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.69K subscribers
Post #67 1.7K
И какой же вывод про RL в рекомендациях?

Учитывая посты, начиная отсюда, можно сделать ряд следующих выводов:

1) Статей на эту тему выходит достаточно много
2) Большая часть этих статей применяет метод без понимания того, зачем это нужно, какую проблему мы решаем, и чем при этом жертвуем
3) Большая часть оставшихся не содержит никакого тестирования на живых пользователях

Чтобы понять проблему оставшихся статей, нужно копнуть глубже.

В чём смысл исследований? Прежде всего, в поиске истины и построении модели мира. Когда у вас есть гипотеза о том, как устроен мир, вы пытаетесь проверять её на прочность, проводя эксперименты. Вы пытаетесь, что называется, prove yourself wrong - найти наблюдение, противоречащее вашей гипотезе. И вы делаете это усиленно, до тех пор, пока гипотеза не станет очень хорошо протестированной.

Утверждение "RL в рекомендациях превосходит классические подходы в чём-либо" - это гипотеза, которая точно не может считаться хорошо протестированной, но подвергнуть её серьёзной проверке практически не пытаются в исследованиях на данную тему. Добросовестный исследователь будет проводить дополнительные проверки, чтобы показать, что именно добавление RL-составляющей в пайплайн и только оно приносит значительную пользу.

К сожалению, практически все оставшиеся статьи не являются исследованиями в чистом смысле. Технические отчёты - да. Рекламные технические блоги - да. Но эти тексты публикуют как научные, они проходят ревью на уважаемых конфах, и потом их массово цитируют. Что с этим делать? Могу сделать только один неутешительный вывод - на слово нельзя верить даже научным статьям.

@knowledge_accumulator
  • 👍 15
  • 🔥 2
  • 😢 2
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →