TGViewer
rizzearch rizzearch @rizzearch · 1.02K subscribers
Post #504 436
Learning Compressed Transforms with Low Displacement Rank

rizzearch throwback

как говорится, хочешь понять человека - прочитай все его папиры в хронологическом порядке. а такого человека-феномена как Три Дао, по нашему мнению, стоит понимать (хотя бы чуть-чуть)

еще до того, как появилась лора, ≥5 лет назад низкоранговые матрицы все равно использовали в дип лернинге. например, для придания какой-то инвариантности или снижения количества параметров. суть еще в том, что такие веса были фиксированы. но данная папира решила это пересмотреть и сделать их обучаемыми, а точнее сделать обучаемыми веса в контексте low displacement rank (определение на первом скриншоте)

so, для этого им пришлось нехило попотеть - моделируют классическую dense матрицу весов при помощи четырех низкоранговых (две из которых тридиагональны или субдиагональны), а matrix-vector product операции производят через связь с матрицами Крылова и свой инференс (с куда кернелами) в “почти линейное время” + не забыли это все приправить теорией о том, что это ускоряет обучение и можно впихивать меньше данных (и даже VC дименшн связан)

экспериментят с млп, свертками и рнн ⇒ количество параметров снижается в несколько раз, а качество качество ухудшается ненамного (утверждают даже, что может при 20-ти кратном снижении кол-ва параметров есть улучшение в перформансе, но это на игрушечной таске)

но почему это не вошло в повсеместное использование? уже тогда появлялись фаундейшн модели, которые обучались и без этой махинации, от которых было удобнее отталкиваться попытке ужать модели при помощи дистилляции и квантизации. но это только наше мнение, если же есть такая задача, где надо с нуля сделать модель с жестким ограничением по количеству параметров, то (возможно) этот метод имеет место быть

👀LINK
More from @rizzearch
  1. Dec 28, 2025π∗0.6: a VLA That Learns From Experience Давно меня не было😚😚😚 В последний раз про pi.w…
  2. Sep 15, 2025К нам часто поступают запросы на темы для курсовых, дипломных или сайд-проектов вне рамок…
  3. Jul 30, 2025Dynamic Chunking for End-to-End Hierarchical Sequence Modeling меня упомянул Борис среди к…
  4. Jul 25, 2025SRT-H: A Hierarchical Framework for Autonomous Surgery via Language Conditioned Imitation…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →