TGViewer
Нейросети на практике Нейросети на практике @neuralfordevs · 66 subscribers
Post #26 103
Как работает кэш токенов?

В процессе написания статьи про HeadroomProxy чуть глубже погрузился в то как работает кэш в LLM.

Посмотрел вот такое неплохое короткое видео.

Но если коротко разбирать, то суть в том, что каждый раз когда LLM обсчитывает новый ответ, ей нужно понять, как каждое слово в вашем предложении связано с другими словами. Этот механизм называется Self Attention.

К примеру “Мама мыла раму”

1) Когда нейронка генерит слово Мама, то она создает карту как мама связана с остальными словами. На первом этапе связывать не с чем
2) Когда нейронка добавляет слово “мыла” то она снова стороит таблицу того, как слово мыла связана со словом Мама и заносит эту таблицу связей в кэш.
3) Тут важный момент: таблица связей односторонняя. ТО есть слово Мама не будет при этом выстраивать связь со словом мыла. То есть этот механизм рабоатет только для прошлых токенов.
4) Такой тип механизма self-attention называется masked attention. И как раз удобен тем, что его результаты удобно кэшировать.
5) Так вот когда вы начинаете генерировать слово раму, то вам уже не нужно вычислять таблицы связей для слов “Мама мыла” так как вы уже все это вычислили, вам нужно вычислить только одну таблицу.

Интересный факт: Есть и другие типы self-attention к примеру Full, который строит связи между всеми словами, но его к примеру невозможно кэшировать и приходится пересчитывать каждый раз с нуля.

Так что существующий механизм кэширования в LLM и снижение стоимости возможно благодаря Masked Self-Attention.
YouTube How KV Cache Speeds Up LLMs for Faster AI Models on GPUs Learn more about LLM inference here → https://ibm.biz/~Ewjm0UejN Why do LLMs crawl when traffic spikes? 🤔 Legare Kerrison explains how KV cache and paged attention reshape GPU memory across prefill and decode to speed up LLM inference. Learn how smarter…
  • 👍 2
  • 🔥 2
  • ⚡ 1
  • 🦄 1
More from @neuralfordevs
  1. Jul 30, 2026🤔 Что выбрать новичку Claude или Codex? Это вопрос, который я часто слышу от тех, кто тол…
  2. Jul 15, 2026#разрушителимифов У Димы, чей разгромный тест Caveman я упоминал неделю назад, вышло новое…
  3. Jul 15, 2026Таки не заленился и написал статью про Headroom!)
  4. Jul 7, 2026🍄 Разрушители мИИфов: тестируем Headroom Когда я писал прошлый разбор про Caveman, то на…
  5. Jun 23, 2026💡 Мысль дня: Устаревание контента и забывание – ключевой процесс для корпоративной Базы з…
  6. Jun 19, 2026👑 Интереная статья от Mindbox: как сделать и поддерживать базу знаний для ИИ Mindbox выка…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →