Всем привет! Объявляем неделю обзоров наиболее интересных, на наш взгляд, статей, представленных на конференции ICML 2025.
В первый день рассмотрим статью о высокопроизводительных трансформерах на базе MatMuls.
Трансформеры — следствие роста популярности языковых моделей. Основной недостаток этой архитектуры — вычислительная стоимость:
🔸много нелинейных операций (aka softmax);
🔸 квадратичная сложность по длине обрабатываемой последовательности (числу слов).
Проблема не нова, поэтому существует масса решений для уменьшения вычислительной сложности, но они либо хуже по качеству, либо требуют тонкой настройки под конкретное hardware, либо дают выигрыш в вычислительной эффективности только на очень длинных последовательностях.
Авторы работы предлагают новую модификацию трансформерной архитектуры, которая существенно снижает вычислительную стоимость и достигает линейной сложности и портативности.
Детали
1. Сокращение числа дорогостоящих операций:
🔸Удаляется softmax в механизме внимания (и вместо него не вносится ничего взамен, как в других работах на эту же тему);
🔸Не используются байесы в слоях нейронных сетей, маскирование, dropout.
🔸Используется одна голова внимания большой размерности вместо нескольких маленьких.
Благодаря этому, механизм внимания становится, по сути, чистыми матричными перемножениеми (слоган “MatMuls are Enough” из названия статьи). Из-за отсутствия нелинейных операций, можно переупорядочить множители в матричном произведении Q*K*V и добиться линейной сложности по длине последовательности.
2. Другие модификации архитектуры:
🔸LayerNorm, основанный на l₂ норме, заменен на MaxNormActivation (l ͚ норма) для стабилизации архитектуры, между блоками внимания и MLP убраны residual connection и LayerNorm и матрицы линейных проекций слиты воедино, чтобы обеспечить большую вычислительную эффективность.
3. Кросс-платформенность и совместимость с любым оборудованием за счет того, что модель написана на чистом PyTorch без использования низкоуровневых оптимизаций CUDA, которыми грешат другие современные архитектуры типа Мамбы.
Результаты
1. Достигли SOTA на GLUE для энкодерных моделей, сравнимых с BERT-Large по числу параметров (340M);
2. SOTA с отрывом на 5% на бэнчмарке Long Range Arena — превзошли все предыдущие модели, основанные на трансформерной архитектуре;
3. Значительно ускорили инференс по сравнению с трансформерами с классическим и линейным механизмом внимания на разных устройствах (H100, A100, CPU).
Тщательная оптимизация архитектуры трансформера позволила существенно увеличить производительность без проигрыша в качестве.
Обзор подготовлен командой AI VK.
#ICML #обзорстатьи
Post #178
1.77K

- 🔥 23
- ❤ 19
- 👀 12