TGViewer
OK ML OK ML @okmlai · 978 subscribers
Post #153 517
Почему внимание — не всегда лучший критерий?

Исследователи из LUMIA Lab (SJTU) и Edinburgh предложили InfoKV  — фреймворк сжатия KV-кэша, который смотрит в будущее! Это как вообще? 🎂

Существующие методы (SnapKV, PyramidKV и др.) выбирают токены по весам внимания, то есть по тому, насколько недавние токены смотрят на прошлые. Это работает для ближнего контекста, но в длинном ризонинге токены важны и для будущих шагов рассуждения. Классический подход предполагает, что важное для текущего контекста останется важным и дальше. Но в длинном ризонинге траектория рассуждения меняется, и токен, который сейчас никому не нужен, может оказаться критичным через тысячи шагов. Авторы показывают это через Forward Influence, влияние высоко-attention токенов быстро затухает с расстоянием, а влияние высокоэнтропийных токенов остаётся сильным даже на горизонте 14K токенов. Интуитивно понятно, кмк. Высокая энтропия при предсказании означает, что токен нес информацию, которую модель не могла вывести из контекста, то есть он содержательный сам по себе.

Кстати, энтропийный скор — это не просто энтропия предсказания, так как она умножается на косинусное расстояние между представлениями токена на промежуточном и последнем слое (плюс bias τ=1), и считается top-k restricted entropy по 256 наиболее вероятным токенам, иначе хвост распределения зашумляет оценку.

Вывод по статье 🍟
Самый эффектный результат статьи — на IFEval для R1-Distill-Llama-8B. При сжатии KV-кэша до 25% и даже 12.5% качество оказалось выше, чем с полным кэшем. Получается, длинные цепочки рассуждений содержат достаточно много малоинформативных токенов, и их удаление экономит память и помогает модели меньше отвлекаться на шум.

P.S. Энтропия сама по себе не заменяет внимание, она дополняет его. В финальной формуле в статье α = 0.9, то есть внимание всё ещё даёт 90% веса, а энтропийный сигнал лишь корректирует выбор. При дальнейшем снижении α качество падает — чистая энтропия хуже на коротких зависимостях (это видно и на Figure 1a, погляди). Так что вывод скорее такой
attention необходим, но недостаточен.

Все!
🤜
  • ❤ 10
  • 😱 7
  • 💯 5
  • 🔥 3
More from @okmlai
  1. Sep 23, 2026Зачем писать стилер, если у пользователя уже есть ИИ-ассистент с доступом ко всему? Патрик…
  2. Sep 21, 2026ИИ получил доступ к своим весам. ЧБД? 16 сентября Irregular опубликовала исследование agen…
  3. Sep 14, 202610 сентября Anthropic опубликовала Detecting and countering misuse of AI — отчёт о злоупот…
  4. Sep 11, 2026Репозиторий недели. Mantis разделить нельзя объединять 📬 У Google есть Mantis — набор нав…
  5. Sep 9, 2026Пароль сменили. Сессии закрыли. А чужие инструкции остались в памяти ИИ. Именно такой сцен…
  6. Sep 4, 2026AI-агенты начали действовать вне инструкций. Вот что нужно знать разработчикам ⤵️ Недавно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →