⚡ Google TurboQuant: KV-кэш LLM сжимается в 6 раз без потери точности
Главная боль развёртывания больших LLM — KV-кэш. 70B-модель для 512 одновременных пользователей жрёт 512 ГБ памяти только на кэш — в 4 раза больше, чем сами веса модели.
Google опубликовал TurboQuant: алгоритм сжимает кэш до 3 бит на канал, даёт до 8x ускорения внимания на H100 и не требует калибровки под каждую модель.
Как работает:
• PolarQuant переводит векторы в полярные координаты — убирает оверхед на нормализацию (экономит 1-2 бита)
• Quantized Johnson-Lindenstrauss (QJL) добавляет случайные проекции с адаптивным квантованием
• Всё вместе: data-oblivious — не нужно подгонять под конкретную модель
Google пока не выпустила код, но комьюнити уже сделало рабочие имплементации на Triton, MLX и llama.cpp просто по статье.
Конкурент — NVIDIA KVTC даёт 20x сжатие, но требует калибровки под каждую модель. Обе работы представлены на ICLR 2026.
Для self-hosting LLM это серьёзно: меньше памяти → больше одновременных пользователей на том же железе.
🏛️ OVHcloud покупает Dragon LLM — первый шаг к суверенной европейской AI
EV-хостинг OVHcloud объявил о покупке Dragon LLM — французского стартапа (ранее Lingua Custodia), победителя Large AI Grand Challenge от Еврокомиссии.
Dragon LLM делает специализированные модели для регулируемых отраслей (финансы и др.) — тонкая настройка LLM под конкретные бизнес-задачи с развёртыванием на локальной инфраструктуре.
OVHcloud запускает свою AI-лабораторию. Для европейского облачного провайдера — логичный ход: найти «своего Mistral» и предложить клиентам суверенные LLM-сервисы в облаке и on-prem.
https://research.google/blog/turboquant-redefining-ai-efficiency-with-extreme-compression/
https://arxiv.org/abs/2603.20397
https://corporate.ovhcloud.com/en/newsroom/news/ovhcloud-dragonllm-ailab/
Post #246
171