TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.69K subscribers
Post #339 4.36K
DiscoRL - out-of-distribution RL наконец-то решён?

Когда я увидел название статьи "Discovering state-of-the-art reinforcement learning algorithms" с David Silver в авторах, я прищурился. Заметив "meta-learning", "Atari", "outperforms manually designed" в абстракте, мой пульс подскочил в полтора раза. "Неужели это оно?" - думал я, открывая статью трясущимися руками.

Итак, в 2020 году вышла статья "Discovering reinforcement learning algorithms" - от того же автора. На заре существования канала я даже делал на неё обзор. Общий принцип работы с тех пор не изменился, просто всё допилено до лучшего состояния. На сайте у первого автора (junhyuk.com), кстати, написано "The majority of the work was finished in 2022.", так что, предположу, что он больше не развивает это направление, и его припахали к Gemini.

Так, обычно в RL-постановке у нас есть нейросеть-агент, которую мы обучаем, к примеру, с помощью Policy Gradient. То есть, определяющим в Policy Gradient является именно алгоритм, который считает таргеты. Подход LPG заключается в том, что мы начинаем генерировать таргеты для обучения отдельной нейросетью, которая и является объектом мета-обучения.

Основной агент выдаёт помимо стандартных policy и q-value ещё 2 вектора - y(s) и z(s, a), которые не имеют заранее определённой семантики.

Ключевой кусок алгоритма - мета-сеть - это LSTM, которая получает на вход траекторию из последних policy, y, z и Q и выдаёт таргеты для обучения - policy*, y* и z*, а основной агент просто обучается их приближать, и дополнительно учит свою Q-функцию также, как и в алгоритме Retrace - какой-то Prior Knowledge тут всё-таки зашит.

Обучают мета-агента, как и в оригинальной статье, с помощью дифференцирования по параметрам мета-сети чем-то на подобие Policy Gradient. С прошлой работой есть много различий в деталях, с которыми мало смысла разбираться. Приятные сюрпризы начинаются в районе результатов.

Что касается общей производительности алгоритма, есть улучшение в качестве относительно бейзлайна, но не прям какое-то экспоненциальное. Самое интересное начинается при тестировании на Out of Distribution Generalization.

Авторы обучили Disco57 на атари и затем гоняли его на других средах. На ProcGen качество получилось выше, чем у бейзлайнов! Ну и на других средах тоже работает нормально. Другая вариация - Disco103, которую обучили ещё на 2 наборах сред, показывает себя ещё лучше на hold-out средах из наборов 4-6, чем Disco57. Так что, какая-то степень генерализации точно присутствует! Авторы справедливо отмечают, что такой результат это что-то новенькое.

Безумно рад видеть прогресс в задаче OOD-RL. Несмотря на прогресс, на мой взгляд, нужно стремиться к результату другого уровня.

Во-первых, уверен, что можно на порядки сокращать количество шагов в среде, которые нужны, чтобы достичь уровней бейзлайнов, или даже набирать теоретический максимум во всех этих играх. Во-вторых, нужно учить алгоритмы в режиме Continual Learning, когда они умеют в ходе своей жизни накапливать знания и переносить скилл из одних игр в другие.

Можно ли достичь этого подобным подходом? Не знаю, для этого надо пушить это направление. Надеюсь, автор когда-нибудь вернётся к этой работе.

@knowledge_accumulator
  • ❤ 15
  • 🔥 8
  • 👍 5
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →