TGViewer
Департамент Разработки Департамент Разработки @devq_a · 1.54K subscribers
Post #334 67
Как сжать KV-кэш LLM в 6 раз, не обучая модель заново?

Исходники TurboQuant уже в опенсорсе, разбираем магию под капотом.

Обычная квантизация требует хранить метаданные (zero points и scaling factors). На экстремально малых битах они сами начинают сжирать всю память, сводя экономию к нулю.

Google обошли это математикой из 3 шагов:

→ PolarQuant (поворот): Векторы кэша умножаются на случайную матрицу. Это делает распределение значений предсказуемым (почти гауссовым) и позволяет полностью выкинуть метаданные.
→ Скалярное сжатие: Координаты независимо квантуются всего до 3 бит.
→ QJL-коррекция: Добавляется 1-битный слой (residual correction) для точной работы механизма attention, чтобы модель не забывала контекст (сохраняется 100% recall в тестах needle-in-a-haystack).

Главная фишка: алгоритм model-agnostic. Никакого файнтюна и датасетов для калибровки. Это drop-in замена (уже есть пакет turboquant), которая дает до 8x ускорения инференса на длинных промптах.

#LLM #AIcoding #architecture

Google Research
  • ❤ 2
More from @devq_a
  1. Oct 6, 2026Пока мы тут реверс-инжинирим конкурентов, Сбер зарелизил генератор видео с синхронным звук…
  2. Oct 6, 2026Нашли ту самую кнопку «Сделать как у конкурентов» — ультимативную тулзу для реверс-инжинир…
  3. Oct 3, 2026DeepSeek представила бесплатного ДЕСКТОП-АГЕНТА. Фишки: • управляет файлами, кодом и терми…
  4. Oct 2, 2026AI-агенты снова засветили 13k+ внутренних скриншотов на GitHub Glow Security нашли, как wo…
  5. Oct 2, 2026DeepSeek Harness Desktop — агент теперь просто .dmg / .exe DeepSeek выпустил официальный d…
  6. Oct 2, 2026Прячемся от волны банов Claude: как полностью очистить метаданные и обойти детекты Anthrop…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →