TGViewer
gonzo-обзоры ML статей gonzo-обзоры ML статей @gonzo_ml · 24.3K subscribers
Post #6006 2.38K
Про важность хороших бейзлайнов и качественную сантехнику.

Sliding-Window Beats Linear Attention
Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais
Paper: https://arxiv.org/abs/2608.28444v1
Review: https://arxiviq.substack.com/p/sliding-window-beats-linear-attention

ЧТО сделали: Авторы поставили под сомнение популярную практику дистилляции стандартных квадратичных LLM в линейные декодеры и гибридные state-space модели. Проведя систематический бенчмарк на семействах моделей от 1.3B до 70B параметров, исследователи показали: обычный механизм Sliding Window Attention с начальными attention sinks, обозначаемый как SWA(w, s), вообще без дообучения не уступает сложным пост-обученным линейным архитектурам на стандартных downstream-задачах, а в длинном контексте и задачах на рассуждение с разгромом их побеждает.

ПОЧЕМУ это важно: Последние пару лет индустрия вливала огромные ресурсы в дистилляцию полносвязных трансформеров в линейные альтернативы вроде LoLCATs и Liger-GLA, стремясь побороть линейный рост KV-кэша. Эта статья вскрывает фундаментальную методологическую ошибку предшественников: линейные методы сравнивали с некорректным бейзлайном — скользящим окном без синк-токенов, которое неизбежно деградирует. Если же взять корректный бейзлайн — локальное окно всего с четырьмя статическими токенами в начале, — многостадийная дистилляция, LoRA-адаптеры и кастомные аппаратные кернелы оказываются попросту лишними.

Для практиков: Обслуживание современных моделей обходится дорого: каждый новый токен диалога раздувает KV-кэш, сжирая видеопамять GPU и замедляя генерацию. Чтобы с этим справиться, инженеры городили замысловатые схемы дистилляции, упаковывая историю контекста в скрытое состояние фиксированного размера. Как выяснилось, элементарный трюк без обучения — закрепить первые 4 токена в роли «якоря» и поддерживать небольшое скользящее окно недавних токенов — даёт сравнимое или даже более высокое качество на бенчмарках, декодирует токены быстрее, расходует меньше памяти и в 2–10 раз превосходит дистиллированные линейные модели при поиске фактов в длинном контексте. Не нужно городить дорогие пайплайны дообучения ради экономии памяти на инференсе: стандартные кернелы внимания с локальным окном и attention sinks обеспечивают превосходную Парето-эффективность прямо из коробки.

Прокачивать слив тут: https://t.me/gonzo_ML_podcasts/4803
arXiv.org Sliding-window beats linear attention Due to the nature of quadratic attention, Large Language Models (LLMs) consume a lot of memory and energy. Every new token costs more than the previous one. For each additional token, the keys and...
  • 👍 15
  • ❤ 7
  • 🔥 5
  • 👎 1
More from @gonzo_ml
  1. Sep 20, 2026photo post
  2. Sep 20, 2026В крупной айти компании работает программист. Рядом на мониторе постоянно запущен оцифрова…
  3. Sep 20, 2026Мемы про муху не прекращаются. Извинити.
  4. Sep 20, 2026photo post
  5. Sep 20, 2026photo post
  6. Sep 20, 2026photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →