TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.69K subscribers
Post #17 833
Reinforcement Learning - главная проблема

То, что в терминах RL можно описать всё, что угодно, показывает, как мало априорной информации нам известно в данной постановке задачи.
- Среда - это чёрный ящик, про неё может быть ничего не известно.
- Награды могут жить своей жизнью, или могут быть сколь угодно редкими.
- Среда может быть рандомной, а информация о состоянии может быть неполной.

На это RL отвечает специфичными методами, которые это берут в расчёт.
При этом в реальных задачах это очень часто не так.

Именно поэтому применений RL в реальности меньше, чем у простого DL - очень часто мы можем, используя информацию о задаче, свести её к частному случаю, в котором есть гораздо более эффективные методы.

Конечно, есть ситуации, когда мы не можем никак свести к более простой постановке, и в этом случае RL как крайняя мера может нам помочь.

В канале я разберу набор статей про применение RL, и аргументирую свою позицию из этого поста.
  • 👍 10
  • 👾 4
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →