TGViewer
AI VK Hub AI VK Hub @aihubvk · 2.48K subscribers
Post #178 1.77K
Всем привет! Объявляем неделю обзоров наиболее интересных, на наш взгляд, статей, представленных на конференции ICML 2025.

В первый день рассмотрим статью о высокопроизводительных трансформерах на базе MatMuls.

Трансформеры — следствие роста популярности языковых моделей. Основной недостаток этой архитектуры — вычислительная стоимость:
🔸много нелинейных операций (aka softmax);
🔸 квадратичная сложность по длине обрабатываемой последовательности (числу слов).

Проблема не нова, поэтому существует масса решений для уменьшения вычислительной сложности, но они либо хуже по качеству, либо требуют тонкой настройки под конкретное hardware, либо дают выигрыш в вычислительной эффективности только на очень длинных последовательностях.

Авторы работы предлагают новую модификацию трансформерной архитектуры, которая существенно снижает вычислительную стоимость и достигает линейной сложности и портативности.

Детали

1. Сокращение числа дорогостоящих операций:
🔸Удаляется softmax в механизме внимания (и вместо него не вносится ничего взамен, как в других работах на эту же тему);
🔸Не используются байесы в слоях нейронных сетей, маскирование, dropout.
🔸Используется одна голова внимания большой размерности вместо нескольких маленьких.

Благодаря этому, механизм внимания становится, по сути, чистыми матричными перемножениеми (слоган “MatMuls are Enough” из названия статьи). Из-за отсутствия нелинейных операций, можно переупорядочить множители в матричном произведении Q*K*V и добиться линейной сложности по длине последовательности.

2. Другие модификации архитектуры:
🔸LayerNorm, основанный на l₂ норме, заменен на MaxNormActivation (l ͚ норма) для стабилизации архитектуры, между блоками внимания и MLP убраны residual connection и LayerNorm и матрицы линейных проекций слиты воедино, чтобы обеспечить большую вычислительную эффективность.


3. Кросс-платформенность и совместимость с  любым оборудованием за счет того, что модель написана на чистом PyTorch без использования низкоуровневых оптимизаций CUDA, которыми грешат другие современные архитектуры типа Мамбы. 


Результаты

1. Достигли SOTA на GLUE для энкодерных моделей, сравнимых с BERT-Large по числу параметров (340M);
2. SOTA с отрывом на 5% на бэнчмарке Long Range Arena — превзошли все предыдущие модели, основанные на трансформерной архитектуре;
3. Значительно ускорили инференс по сравнению с трансформерами с классическим и линейным механизмом внимания на разных устройствах (H100, A100, CPU).

Тщательная оптимизация архитектуры трансформера позволила существенно увеличить производительность без проигрыша в качестве.

Обзор подготовлен командой AI VK.

#ICML #обзорстатьи
  • 🔥 23
  • ❤ 19
  • 👀 12
More from @aihubvk
  1. Oct 1, 2026🟣Inception: диффузионные LLM для низкой задержки 8 сентября Inception выпустила Mercury 2…
  2. Sep 30, 2026Как работают товарные рекомендации для Ленты ВКонтакте 📱 В Ленте ВКонтакте существуют раз…
  3. Sep 29, 2026SESAME: смесь экспертов в шумоподавлении речи Команда студентов мастерской ИИ Инженерно-ма…
  4. Sep 25, 2026Пользователь смотрит видео, листает клипы, ставит лайки — каждое действие становится сигна…
  5. Sep 23, 2026Кеш кандидатов: как рекомендеры VK тратят меньше железа Каждый запрос к рекомендеру стоит…
  6. Sep 22, 2026Post #627
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →