Группа ученых из Китая выпустила обстоятельный обзор современных архитектур больших языковых моделей «Speed Always Wins» на основе почти 450 источников.
Статья: https://arxiv.org/pdf/2508.09834
В ней авторы коснулись ключевых технологий, лежащих в основе современных LLM, позволяющих ускорять модели и/или экономить память:
1) Линейное моделирование последовательностей с помощью линейного внимания (Attention), линейных RNN, моделей на основе пространства состояний (SSM).
2) Разреженное моделирование последовательностей с помощью, в том числе, разреженных модулей внимания.
3) Технологии на основе смеси экспертов (Mixture of Experts, MoE).
4) Технологии повышения эффективности модулей внимания типа Flash Attention.
5) Гибридные архитектуры.
6) Набирающие популярность Диффузионные LLM (DLLM).
Отдельно отмечены особенности применения различных архитектур для обработки и распознавания изображений, аудио, мультимодальных данных.
GitHub: https://github.com/weigao266/Awesome-Efficient-Arch
#References
Post #87
461




- 🔥 1