🔥 Архитектуру LLM можно «сломать» для длинного контекста ещё до того, как началось обучение на длинном контексте
Исследователи Ai2, CMU и University of Washington обучили 26 сопоставимых моделей на 7B параметров. Данные, токенизатор и способ расширения контекста оставили одинаковыми, меняли только четыре архитектурных решения: QK normalization, GQA, sliding-window attention и длину контекста на этапе pretraining.
По отдельности почти каждое изменение вредило совсем немного. Но вместе эффект резко усиливался.
На HELMET при 32K контексте результаты моделей разошлись от 56,4 до 29,9 балла, хотя на обычных коротких eval-тестах разница почти не проявлялась. В худших конфигурациях падение достигало 47%.
SWA сам по себе давал небольшой минус, но поверх GQA просадка становилась значительно сильнее.
Архитектурные ограничения, заложенные ещё на pretraining, продолжали влиять на результат после расширения окна.
Смотреть только на loss и короткие benchmarks недостаточно. Архитектуру стоит тестировать на длинном контексте ещё на ранних checkpoint'ах, иначе проблема может обнаружиться уже после огромных затрат на обучение.
Исследователи потратили на эксперименты более 170 000 GPU-часов и открыли все 26 моделей как набор OlmPool.
Paper: arxiv.org/abs/2608.10296
Post #5609
4.62K

- ❤ 8
- 🔥 6
- 👍 5
- 🤩 1