TGViewer
OpenClaw и Hermes канал про ИИ-агентов OpenClaw и Hermes канал про ИИ-агентов @openclawc · 351 subscribers
Post #246 171
⚡ Google TurboQuant: KV-кэш LLM сжимается в 6 раз без потери точности

Главная боль развёртывания больших LLM — KV-кэш. 70B-модель для 512 одновременных пользователей жрёт 512 ГБ памяти только на кэш — в 4 раза больше, чем сами веса модели.

Google опубликовал TurboQuant: алгоритм сжимает кэш до 3 бит на канал, даёт до 8x ускорения внимания на H100 и не требует калибровки под каждую модель.

Как работает:
• PolarQuant переводит векторы в полярные координаты — убирает оверхед на нормализацию (экономит 1-2 бита)
• Quantized Johnson-Lindenstrauss (QJL) добавляет случайные проекции с адаптивным квантованием
• Всё вместе: data-oblivious — не нужно подгонять под конкретную модель

Google пока не выпустила код, но комьюнити уже сделало рабочие имплементации на Triton, MLX и llama.cpp просто по статье.

Конкурент — NVIDIA KVTC даёт 20x сжатие, но требует калибровки под каждую модель. Обе работы представлены на ICLR 2026.

Для self-hosting LLM это серьёзно: меньше памяти → больше одновременных пользователей на том же железе.

🏛️ OVHcloud покупает Dragon LLM — первый шаг к суверенной европейской AI

EV-хостинг OVHcloud объявил о покупке Dragon LLM — французского стартапа (ранее Lingua Custodia), победителя Large AI Grand Challenge от Еврокомиссии.

Dragon LLM делает специализированные модели для регулируемых отраслей (финансы и др.) — тонкая настройка LLM под конкретные бизнес-задачи с развёртыванием на локальной инфраструктуре.

OVHcloud запускает свою AI-лабораторию. Для европейского облачного провайдера — логичный ход: найти «своего Mistral» и предложить клиентам суверенные LLM-сервисы в облаке и on-prem.

https://research.google/blog/turboquant-redefining-ai-efficiency-with-extreme-compression/
https://arxiv.org/abs/2603.20397
https://corporate.ovhcloud.com/en/newsroom/news/ovhcloud-dragonllm-ailab/
arXiv.org KV Cache Optimization Strategies for Scalable and Efficient LLM Inference The key-value (KV) cache is a foundational optimization in Transformer-based large language models (LLMs), eliminating redundant recomputation of past token representations during autoregressive...
More from @openclawc
  1. Oct 1, 2026Как сэкономить токены в Claude Code ультимейт гайд Основанный на моем более чем 1.5 годово…
  2. Jun 13, 2026Сижу я за своим Маком работаю и тут что-то начинает шарится по моим личным папкам Я по Pyt…
  3. Jun 11, 2026Попользовался этим Hermes Desktop с неделю - все очень очень сыро То что обновляется кажды…
  4. Jun 9, 2026На Хабре вышел толковый пост Hermes Agent Desktop: настройка под реальные задачи Автор мес…
  5. Jun 6, 2026Компания Nous разработавшая агента Hermes выпустили Desktop App Я протестировал - мне очен…
  6. Jun 6, 2026Channel name was changed to «OpenClaw и Hermes канал про ИИ-агентов»
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →