Learning to Modulate pre-trained Models in RL (NeurIPS 2023)
Вспоминаем один из наших предыдущих постов про catastrophic forgetting. Так вот авторы данной статьи решают эту проблему совершенно другим способом для того, чтобы адаптировать это все под среды с разными входными пространствами
Что они делают? берут каузальный трансформер (который просто на конкретном таймстепе последовательности смотрит только на предыдущие токены) и при помощи лоры дообучают его на новые таски. При том у нас не пара матриц для каждого слоя как по классике, а множество таких матриц, из которого мы с помощью обучаемого ключа вытаскиваем конкретные матрицы, которыми и файнтюним нашу основную модельку
Получаем совмещение Population Based Training + Parameter Efficient Fine-Tuning, где старые таски не забываются, а на новых достигается хороший результат
👀LINK
#rl #metarl #finetuning #lora #learning2modulate
Post #86
173

