🔎 Looped-модели научились экономить память: качество 12 блоков при KV-кэше на 4
Looped-модели прогоняют токен через один и тот же блок слоёв несколько раз, и так глубина растёт без роста параметров. Мешало одно: на каждой итерации копится свой KV-кэш, и память раздувается.
Авторы заметили, что внутреннее состояние модели со временем почти перестаёт меняться. Поэтому на декодинге можно хранить только финальные ключи и значения, а не всю цепочку итераций.
На модели 1.6B это дало 60% в среднем по бенчмаркам. Обычный трансформер из 4 блоков набирает 51%, из 12 блоков 61.5%. Получается почти уровень 12 блоков при втрое меньшем KV-кэше. Бонусом промпт обрабатывается до 1.79 раза быстрее, а RL-обучение идёт вдвое быстрее.
Код и 49 чекпоинтов открыты.
https://arxiv.org/abs/2610.06833
https://github.com/ifm-ai/xllm-loop
Post #5916
1.99K

- ❤ 10
- 👍 3
- 🔥 3
- 🤔 2
- 🎉 2
- 💯 2
- 👏 1