TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.69K subscribers
Post #104 2.25K
EfficientZero [2021] - "data-эффективный" RL

Я давно обозначал проблему большинства методов RL - чудовищная требовательность к объёму данных в связи с необходимостью извлекать зависимости между наблюдениями в разных временных точках. Фундаментально от неё никуда не деться, если мы пытаемся учить общий RL-алгоритм на задаче с нуля, но на практике "data-эффективность" ухудшается ещё сильнее из-за несовершенства методов. Сегодня поговорим об EfficientZero - алгоритме, занимающим первое место в обучении играм Atari за 100к кадров обучения.

Алгоритм базируется на MuZero, про который я писал ранее. Этот метод обучает "модель" среды, но предсказывает не сами будущие состояния, а только будущие награды и действия самого же агента в следующих шагах. Это облегчает задачу и избавляет от ненужной задачи генерации следующего состояния. Далее по дереву этих подобий "состояния" (назовём их эмбеддингами состояния) делается поиск, как в AlphaZero. Обсудим улучшения, которые привели к победе над конкурентами.

1) Self-Supervised Consistency Loss
Это способ использовать информацию о будущем состоянии при обучении, не пытаясь его предсказать. У нас есть энкодер текущего состояния в эмбеддинг, а также сетка, которая по эмбеддингу предсказыват эмбеддинг на следующем шаге. Так вот, эта регуляризация требует, чтобы энкодер + переход от текущего состояния выдавал то же, что и энкодер от следующего. Вполне логичное требование.
2) Model-Based Off-Policy Correction
Используемый RL-метод изначально предполагает, что мы собираем данные какой-то стратегией, обновляем её и выбрасываем все данные на помойку. В связи с распределённой и асинхронной природой обучения метода на большом кластере, это нарушается, и в метод добавляются различные компенсирующие костыли. Идея этого в том, что на "предсказания будущего" агента опираются тем меньше, чем более "старая" траектория используется для обучения.
3) End-To-End Prediction of the Value Prefix
При подсчёте таргета используется предсказанная в будущем сумма наград на k шагов вперёд. Теперь мы предсказываем всю сумму одновременно, а не награды по отдельности, чтобы потом просуммировать.

Проще объяснить эти нововведения невозможно, к сожалению, за подробными объяснениями лучше обратиться к статье или обзору. Итоговый метод с очень большим отрывом побеждает всех остальных конкурентов, с чем авторов и поздравляем.

@knowledge_accumulator
  • 👍 13
  • 🔥 4
  • ❤ 1
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →