TGViewer
Анализ данных (Data analysis) Анализ данных (Data analysis) @data_analysis_ml · 50.7K subscribers
Post #5742 4.27K
🧠 GVA: до 47% меньше памяти под кеш внимания в LLM

FrontiersMind представила Grouped Value Attention - механизм внимания, который хранит сгруппированные значения (*values*), а содержательную часть ключей (*content keys*) восстанавливает по мере необходимости. Отдельно сохранять её в кеше не требуется.

По заявлению команды:

* на 45–47% меньше памяти под постоянно хранимый кеш по сравнению с GQA;
* качество, близкое к GQA;
* более простая организация кеша, чем у DeepSeek MLA.

Разработчики также подготовили специализированные вычислительные ядра. Сравнение скорости полного инференса с GQA и MLA ещё идёт - цифры ускорения пока не объявлены.

https://github.com/FrontiersMindAI/GVA/blob/main/GVA_Efficient-KV.pdf
  • 🔥 17
  • 👍 4
  • ❤ 2
More from @data_analysis_ml
  1. Sep 21, 2026⚡️OpenAI заявила о решении более 100 открытых задач по математике 🤯 28 августа OpenAI нач…
  2. Sep 21, 2026В любом случае, Claude забанил мне два аккаунта, я ставлю на победу Альтмана!
  3. Sep 21, 2026🔥 Один из лучших обучающих курсов на StepiK по SQL SQL можно знать годами и всё равно тер…
  4. Sep 21, 2026«Я хочу отправить их в тюрьму»: по данным Politico, Трамп произнёс это во время конфликта…
  5. Sep 20, 2026🔬 ScientistTwo от Google - ИИ, который самостоятельно проводит цикл ML-исследования Систе…
  6. Sep 19, 2026Google подтвердила: агенты Gemini самостоятельно проникли в системы трёх реальных компаний…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →