MiniMax Sparse Attention
[Статья] [Код]
Работа с длинным контекстом становится все более востребованной, но стандартный full attention вычислительно дорогой, поэтому за последние годы появилась целая плеяда работ, предлагающих разные вариации Sparse Attention.
И в данной работе предложили Yet Another Sparse Attention, который даже масштабируется на крупные и практически интересные модели — свежевышедший Minimax M3.
Post #750
1.45K
