Resurrecting Recurrent Neural Networks for Long Sequences
Относительно давняя статья, которую уже можно считать базой
дипмаинды решили освежить рннки и привнести в них заново жизнь. они смогли получить такой же скор на Long Range Arena, что и ссмки, не уступая по вычислительной эффективности
Для этого пришлось уйти от парадигмы - убрать нелинейность из рнн блока. и хоть по теории это звучит абсурдно, потому что именно эта нелинейность (сигмоида, танх) позволяет рннке быть полной по Тьюрингу, но “линейная” рнн достигает даже лучшего результата чем классические сетапы
но этого недостаточно, чтобы получить такую же эффективность, как и ссм. как и стейт-спейс модели, авторы обучают свою новую рннку матрицами комплексных пространств чтобы получить такую же способность к выявлению паттернов, а так же
- диагонализуют обучаемые матрицы и часть обучения происходит в комплексно-диагональном пространстве, пространстве собственных значений
- заменяют HiPPO инициализацию на более легкую, известную всем формулу еще с первого курса университета (назвали ее stable exp parametrization)
- добавляют зависимую от “обучаемых eigenvalues” нормализацию, которая привносит постоянство, схожее с диффурами, которые стоят за ссм
И получается интересный Linear Recurrent Unit (LRU) 🫡
P.S. мы писали до этого про гибрид от тех же дипмаиндов, где они используют Real-Gated LRU, которые сами придумали. основное отличие - уходят от комплексных пространств, потому что по их опыту комплексные пространства плохо справляются с language modelling. pay attention to the evaluation protocol😎
👀LINK
Post #183
406



- 👍 4
- 🔥 3
- ❤ 1
- 👀 1