TGViewer
КПД КПД @quant_prune_distill · 3.49K subscribers
Post #761 1.69K
🔬 Метод

Разобьем последовательность на префикс P и суффикс S.

Пусть N — числитель, а D — знаменатель. Тогда выход внимания имеет следующий вид:

O = (N_P + N_S) / (D_P + D_S)

Предположим, что для текущей query нашлась достаточно близкая (по какой-то мере похожести).

Тогда мы можем переиспользовать предпосчитанные числитель и знаменатель от этой близкой query, и остается только посчитать члены между той query и текущей позицией.

⚙️ Важные практические соображения

Хранить целесообразно небольшой скользящий буфер query. Полный query cache (в силу распространения GQA / MLA) будет в разы дороже KV-кэша, да и выигрыш тем больше, чем больше токенов мы переиспользуем (чем ближе по позиции близкая query к текущей).

Хотим, с одной стороны, переиспользовать как можно больше вычислений, но при этом не терять в качестве.

В качестве меры похожести используется L2-расстояние между pre-RoPE ключами. pre-RoPE критично, иначе близкие семантически query разъедутся из-за позиционных эмбеддингов. Если похожая query не нашлась (минимальная ошибка выше порога), то считаем так, как считали бы при стандартном инференсе.

Под это все у них есть самописные кернелы эффективного поиска похожей query и внимания с переиспользованием вычислений.

📊 Эксперименты

Метод валидируют на моделях семейства Llama-3.1 / GLM-4 / Phi-4 и бенчах на длинный контекст LongBench v1/v2 и RULER.

На практике берут окно из 1024 последних токенов для поиска ближайшей query, а порог близости был как-то подобран вручную.

Качество якобы не просаживается, а где-то даже и растет (даже на бюджетах порядка 1%). Но похоже на скам.

Свои кернелы они интегрировали в SGLang и утверждают, что достигают 4× уменьшения latency attention против full attention и работают быстрее всяких прунингов. Подозрительно, что RocketKV такой медленный…

🚀 На больших батчах и с 99% sparsity говорят, что якобы ускоряют внимание до 40 раз.

💾 Сам метод дает примерно 5% дополнительного оверхеда по GPU-памяти (в зависимости от числа групп в GQA) на длине контекста 128k с настройками по умолчанию.

📝 Вывод

Идейка прикольная, даже удивительно, что до нее додумались сравнительно недавно — только в апреле этого года.

Не хватает замеров на более серьезных моделях и бенчах (типа математики, кода и агентских задач), а также end-to-end сравнений по скорости.
  • 🔥 8
More from @quant_prune_distill
  1. Oct 5, 2026Теперь уже даже время прочтения блога это ориентир не для человека, а для LLMки. https://r…
  2. Oct 4, 2026"Горячие" эксперты
  3. Oct 4, 2026photo post
  4. Oct 1, 2026🛠 Метод Типичный scaling law имеет вид: L(N, D) = A N^α + B D^β + c 🔄 Скейлинг по рекурс…
  5. Oct 1, 2026Scaling Laws for Looped Mixture of Experts 📄 Статья Есть MoE, которые как-то скейлятся (п…
  6. Sep 29, 2026⚙️ Метод На префилле имеем дело с тяжёлыми матричными умножениями, поэтому для ускорения ц…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →