🔥 Полное внимание возвращается: 9× ускорение префилла на 1M токенов
Alibaba и Нанкинский университет показали метод RTPurbo. На контексте в миллион токенов префилл ускоряется до 9,36× относительно FlashAttention-2, декодинг - примерно вдвое. Качество на длинных бенчмарках остаётся близким к full attention, а адаптация лёгкая: переобучать модель с нуля не нужно.
Идея в том, что внутри уже обученной модели с full attention есть скрытая разреженность. Не все attention heads реально ходят за дальними токенами. Большинство работает локально, а за retrieval из далёкого контекста отвечает только небольшая часть голов.
RTPurbo считает полное внимание только для этих retrieval-голов. Остальным хватает соседнего окна.
Для поиска нужных токенов используется дешёвый 16-мерный индексатор. Он не заменяет настоящее внимание, а работает как разведчик: быстро отбирает кандидатов из прошлого контекста, после чего честное внимание считается уже на маленьком наборе токенов в полной размерности.
Длинный контекст стоит дорого не потому, что вся история одинаково важна, а потому что мы часто считаем внимание там, где оно почти ничего не меняет.
RTPurbo показывает, что значительную часть вычислений можно срезать инженерно, без полного переобучения модели и без заметной потери качества.
В full attention много лишней работы, и её можно убирать гораздо аккуратнее, чем просто резать контекст или надеяться на магию sparse attention.
arxiv.org/abs/2605.16928v1
Post #1349
2.49K

- ❤ 2
- 🙏 1