TGViewer
Кисель в АйТи | AI и технологии Кисель в АйТи | AI и технологии @kisel_it · 4.34K subscribers
Post #305 1.04K
Нежданно-негаданно. Вот так вот вдруг Google выкатил TurboQuant — и это, возможно, главная новость с начала года в ML.

Освежим в памяти: когда LLM ведёт с тобой длинный диалог, она хранит в памяти GPU «заметки» обо всём, что уже обсудили. Это называется KV-кэш, и именно он сжирает всю память при длинных промптах.

TurboQuant сжимает этот кэш в 6 раз. Ускоряет вычисления до 8x. Без потери качества. Без дообучения модели. Просто подключил - и работает.

Открытого кода от Google пока нет, но статья уже принята на ICLR 2026.

Сейчас на потребительской GPU с 24 ГБ VRAM можно крутить 7B-модель, но с контекстом 4-8k. Если KV-кэш ужимается в 6 раз, тот же ноутбук тянет 32-64k контекста. Для локальных ассистентов и всего, где важна приватность - это качественный скачок, который открывает много новых дорог новым инструментам. Миллион токенов контекста перестанут быть роскошью. Возможно мы увидим модели с контекстом на порядки выше.

Что ж, посмотрим что нас ждёт дальше.
  • ❤ 9
  • 👍 5
  • 🔥 5
More from @kisel_it
  1. Oct 5, 2026Кажется, я нашёл, где можно нормально проверить своих ИИ-агентов в бою 😅 Сегодня зарегист…
  2. Oct 3, 2026Кажется, OpenAI тихо докрутили multi-agent режим на декстопе в ChatGPT. Сегодня дал ему за…
  3. Oct 2, 2026Как получать офферы на 250к+ на стагнирующем backend-рынке в 2026? Для начала — знать реал…
  4. Oct 2, 2026Антропики настолько переживают за будущее человечества и неконтролируемую гонку ИИ, что ре…
  5. Oct 1, 2026Я уже давно хотел завести рубрику про дни рождения людей, которые сильно повлияли на прогр…
  6. Sep 30, 2026Так, ну этим я точно не могу не поделиться. Dot для себя сгенерировал целый пак анимаций п…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →