TGViewer
rizzearch rizzearch @rizzearch · 1.02K subscribers
Post #86 173
Learning to Modulate pre-trained Models in RL (NeurIPS 2023)

Вспоминаем один из наших предыдущих постов про catastrophic forgetting. Так вот авторы данной статьи решают эту проблему совершенно другим способом для того, чтобы адаптировать это все под среды с разными входными пространствами

Что они делают? берут каузальный трансформер (который просто на конкретном таймстепе последовательности смотрит только на предыдущие токены) и при помощи лоры дообучают его на новые таски. При том у нас не пара матриц для каждого слоя как по классике, а множество таких матриц, из которого мы с помощью обучаемого ключа вытаскиваем конкретные матрицы, которыми и файнтюним нашу основную модельку

Получаем совмещение Population Based Training + Parameter Efficient Fine-Tuning, где старые таски не забываются, а на новых достигается хороший результат

👀LINK

#rl #metarl #finetuning #lora #learning2modulate
More from @rizzearch
  1. Dec 28, 2025π∗0.6: a VLA That Learns From Experience Давно меня не было😚😚😚 В последний раз про pi.w…
  2. Sep 15, 2025К нам часто поступают запросы на темы для курсовых, дипломных или сайд-проектов вне рамок…
  3. Jul 30, 2025Dynamic Chunking for End-to-End Hierarchical Sequence Modeling меня упомянул Борис среди к…
  4. Jul 25, 2025SRT-H: A Hierarchical Framework for Autonomous Surgery via Language Conditioned Imitation…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →