TGViewer
rizzearch rizzearch @rizzearch · 1.02K subscribers
Post #655 473
DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads

автор недавно упомянутых ретривал голов и аттеншн синков решил объединить эти 2 концепции и нехило так сэкономить по памяти для кв кэша

продолжая идею, которой они прогревали в статье про ретривал головы, про компрессию кв кэша - давайте хранить весь кэш только для этих голов, а остальным оставлять кэш только для синк токенов и недавних токенов (степень “недавности” определяется гипером в соответствии с трейдоффами по памяти и перформансу)

определяют же ретривал головы в этот раз по другому сетапу - ставят обучаемый гейт на каждую голову каждого слоя, с помощью которого фиксируют пропорцию между фулл аттеншном и “стриминг аттеншном” + л1 регуляризация. получается num_layers x num_heads параметров, которые можно зафиттить на классический форвард пасс за 2к степов на 8 а100 (по заверениям авторов). обучались же на их синтетике (не особо понятно почему это было проще чем запустить сразу на needle in a haystack + есть вопросы по поводу того, действительно ретривал головы не меняются если менять датасеты на которых мы их ищем)

а в принципе звучит даже интересно, посмотрим как приживется, если они код смогут попроще причесать

👀LINK
  • 👍 6
More from @rizzearch
  1. Dec 28, 2025π∗0.6: a VLA That Learns From Experience Давно меня не было😚😚😚 В последний раз про pi.w…
  2. Sep 15, 2025К нам часто поступают запросы на темы для курсовых, дипломных или сайд-проектов вне рамок…
  3. Jul 30, 2025Dynamic Chunking for End-to-End Hierarchical Sequence Modeling меня упомянул Борис среди к…
  4. Jul 25, 2025SRT-H: A Hierarchical Framework for Autonomous Surgery via Language Conditioned Imitation…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →