🧠 GVA: до 47% меньше памяти под кеш внимания в LLM
FrontiersMind представила Grouped Value Attention - механизм внимания, который хранит сгруппированные значения (*values*), а содержательную часть ключей (*content keys*) восстанавливает по мере необходимости. Отдельно сохранять её в кеше не требуется.
По заявлению команды:
* на 45–47% меньше памяти под постоянно хранимый кеш по сравнению с GQA;
* качество, близкое к GQA;
* более простая организация кеша, чем у DeepSeek MLA.
Разработчики также подготовили специализированные вычислительные ядра. Сравнение скорости полного инференса с GQA и MLA ещё идёт - цифры ускорения пока не объявлены.
https://github.com/FrontiersMindAI/GVA/blob/main/GVA_Efficient-KV.pdf
Post #5742
4.27K

- 🔥 17
- 👍 4
- ❤ 2