Про важность хороших бейзлайнов и качественную сантехнику.
Sliding-Window Beats Linear Attention
Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais
Paper: https://arxiv.org/abs/2608.28444v1
Review: https://arxiviq.substack.com/p/sliding-window-beats-linear-attention
ЧТО сделали: Авторы поставили под сомнение популярную практику дистилляции стандартных квадратичных LLM в линейные декодеры и гибридные state-space модели. Проведя систематический бенчмарк на семействах моделей от 1.3B до 70B параметров, исследователи показали: обычный механизм Sliding Window Attention с начальными attention sinks, обозначаемый как SWA(w, s), вообще без дообучения не уступает сложным пост-обученным линейным архитектурам на стандартных downstream-задачах, а в длинном контексте и задачах на рассуждение с разгромом их побеждает.
ПОЧЕМУ это важно: Последние пару лет индустрия вливала огромные ресурсы в дистилляцию полносвязных трансформеров в линейные альтернативы вроде LoLCATs и Liger-GLA, стремясь побороть линейный рост KV-кэша. Эта статья вскрывает фундаментальную методологическую ошибку предшественников: линейные методы сравнивали с некорректным бейзлайном — скользящим окном без синк-токенов, которое неизбежно деградирует. Если же взять корректный бейзлайн — локальное окно всего с четырьмя статическими токенами в начале, — многостадийная дистилляция, LoRA-адаптеры и кастомные аппаратные кернелы оказываются попросту лишними.
Для практиков: Обслуживание современных моделей обходится дорого: каждый новый токен диалога раздувает KV-кэш, сжирая видеопамять GPU и замедляя генерацию. Чтобы с этим справиться, инженеры городили замысловатые схемы дистилляции, упаковывая историю контекста в скрытое состояние фиксированного размера. Как выяснилось, элементарный трюк без обучения — закрепить первые 4 токена в роли «якоря» и поддерживать небольшое скользящее окно недавних токенов — даёт сравнимое или даже более высокое качество на бенчмарках, декодирует токены быстрее, расходует меньше памяти и в 2–10 раз превосходит дистиллированные линейные модели при поиске фактов в длинном контексте. Не нужно городить дорогие пайплайны дообучения ради экономии памяти на инференсе: стандартные кернелы внимания с локальным окном и attention sinks обеспечивают превосходную Парето-эффективность прямо из коробки.
Прокачивать слив тут: https://t.me/gonzo_ML_podcasts/4803
Post #6006
2.38K