TGViewer
DL in NLP DL in NLP @dlinnlp · 11.6K subscribers
Post #1764 11.2K
MLKV: Multi-Layer Key-Value Heads for Memory Efficient Transformer Decoding
Zuhri et al
arxiv.org/abs/2406.09297

Помните multi-query attention где вместо того чтобы у вас были разные key, query, value на каждую голову вы используете одни и те же kv для всех и разными бывают только query? Это очень классная идея которая сильно сокращает размер kv cache позволяя упихивать более длинные тексты или большие батчи в тот же объем памяти с минимальной потерей качества.

Авторы multi-layer kv heads предлагают сделать еще один шаг в эту сторону и предлагают шарить kv между соседними слоями тоже. То есть мы разбиваем наши слои на блоки, например по 4 слоя. И в каждой группе из 4 слоёв только лишь первый слой считает kv, остальные используют только query.

Потеря качества хоть и небольшая, но достаточно заметная, но иногда приходится упихивать неупихиваемое в GPU и хорошо иметь больше способов делать tradeoffs.
  • 👍 41
  • 🔥 11
  • ❤‍🔥 6
  • ❤ 4
  • 👎 2
  • 👀 1
More from @dlinnlp
  1. Feb 21, 2025https://www.youtube.com/watch?v=uVcBa6NXAbk https://www.1x.tech/discover/introducing-neo-g…
  2. Jan 27, 2025В продолжение темы, Jay Alammar, у которого были прекрасные визуальные объяснения про рабо…
  3. Jan 23, 2025Всем приветики. Давно не было постов, тк становится всё сложнее вести канал. Не буду обеща…
  4. Nov 23, 2024Programming Massively Parallel Processors https://a.co/d/6QEiuCq Наткнулся на книгу котора…
  5. Oct 10, 2024Но дадут ли нобелевку по литературе за Deep Learning Book
  6. Oct 8, 2024Почему не стоит верить nvidia-smi “GPU utilization” arthurchiao.github.io/blog/understandi…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →