Reset & Distill: A Recipe for Overcoming Negative Transfer in Continual Reinforcement Learning
Мы привыкли, что трансфер лернинг - полезная вещь, потому что дает отфайнтюнить крутую модель на более узкую задачу (в основном). На самом деле это не совсем так, ведь если домен претрена и домен для файнтюна сильно не совпадают, то трансфер лернинг только ухудшит перформанс, чем если обучать модель с нуля с рандом инитом
Это более глубокая проблема, потому что она происходит как в continual learning, так и в continual rl, где с течением времени домен (таска) тем или иным Образом обновляется и надо показывать хороший результат как на нем, так и на всех предыдущих доменах (тасках)
Загвоздка в том, что по отдельности эти таски хорошо выучиваются, но вот если файнтюнить агента на новой таске, то все ломается, а нам бы хотелось не много-много агентов, каждый из которых хорошо работает на отдельных тасках, а одного мультитаск гигачада
Авторы в континуал рл решают эту проблему тем, что на каждую таску тренят отдельного агента (онлайн агента), собирают его экспертный датасет, и уже потом дистиллят этот датасет в основного агента (оффлайн), который старается сохранять мультитаскность по истории тасок, онлайн агент ресетится и все повторяется
(Костыльная) Простота - сестра таланта😎
👀LINK
#rl #continuallearning #continualrl #reset #distillation #behaviorcloning #plasticity #stability
Post #75
202


- 👍 3
- ❤ 1
- 🔥 1