TGViewer
КПД КПД @quant_prune_distill · 3.48K subscribers
Post #834 1.54K
Language Models Can Control Their Own Attention 🧠

📄 Статья

В современных LLM большинство слоев, смешивающих токены, представляют собой более дешевые (в сравнении с классическим attention) по длине последовательности GDN, SSM-ки или внимание со скользящим окном.

Тем не менее, full attention-слои пока еще не полностью канули в Лету и все еще перетягивают на себя значительную часть объема вычислений на длинных последовательностях.

Однако для предсказания следующего токена редко нужен весь прошлый контекст: внимая малому числу токенов, можно дать верный ответ. Но как найти это малое число токенов? Есть обучаемые селекторы, как в последних DeepSeek, MiniMax и Qwen.

Но что, если сама LLM знает, что ей надо? 🤔

И авторы предлагают модели самой выбрать, куда смотреть (Declarative Attention), и при этом без специального обучения.
  • 👍 4
  • 🔥 2
More from @quant_prune_distill
  1. Oct 1, 2026🛠 Метод Типичный scaling law имеет вид: L(N, D) = A N^α + B D^β + c 🔄 Скейлинг по рекурс…
  2. Oct 1, 2026Scaling Laws for Looped Mixture of Experts 📄 Статья Есть MoE, которые как-то скейлятся (п…
  3. Sep 29, 2026⚙️ Метод На префилле имеем дело с тяжёлыми матричными умножениями, поэтому для ускорения ц…
  4. Sep 29, 2026🧩 Disaggregated Quantization: Specializing LLM Prefill and Decode 📄 Статья Обычно для пр…
  5. Sep 24, 2026Метрики, которые мы заслужили. Карточка модели на лицехватс
  6. Sep 23, 2026🛠️ Метод Авторы предлагают довольно интересную схему генерации негативного условия: - 📝…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →