TGViewer
Приближаем сингулярность Приближаем сингулярность @building_singularity · 887 subscribers
Post #89 959
Mixture-of-Depths: Dynamically allocating compute in transformer-based language models

DeepMind недавно выпустил статью про улучшение лосса у LLM при том же бюджете на компьют.

Основано всё на том, что трансформеры используют компьют неоптимально: не на все токены нужно прогонять все слои, не на все токены нужно аттендиться.

Роутер в Mixture-of-Experts определяет, в какой MLP подать токен. В этой же работе роутер Mixture-of-Depths определяет, прогонять ли токен через Self-Attention & MLP или оставить его как есть. Получается, что через слой MoD проходит только часть токенов (часть входной последовательности).

То есть на обучении (когда делаем forward pass сразу на всей последовательности)
(1) через каждый слой (= глубину LLM) проходит заранее заданное число токенов K, которое может быть сильно меньше общей длины (авторы 12.5% используют, правда слой MoD чередуется с обычным транcформером, где всё используется)
(2) Self-Attention вычисляется на этом же подмножестве из выбранных top-K токенов

Роутер обучаемый, для каждого токена выдает одно число: его важность для данного слоя.

Ещё одно преимущество подхода: константа K задается заранее, поэтому вычислительный граф при обучении не меняется (статичный). В Self-Attention & MLP всегда пойдет K токенов. Это дает доп выигрыш в скорости.

Таким образом, варьируя K можно делать трейдофф между качеством и скоростью, достигать лучшего лосса при заданном бюджете на компьют.

В общем, архитектура трансформера достаточно неоптимальная и заметное ускорение при том же качестве можно выжимать и на software части, а не только hardware.

@building_singularity
  • 👍 10
  • 🔥 5
  • ❤ 2
More from @building_singularity
  1. Aug 8, 2025И забавно, и грустно…
  2. Jul 22, 2025Последние 5 месяцев работаю в стартапе Slingshot AI. И сегодня мы публично анонсируем наш…
  3. Nov 29, 2024H100 девешле A100 Я уже писал про тренд на уменьшение цены инференса LLM. Недавно на работ…
  4. Nov 24, 2024Big life update 🚀 Были довольно напряжные и загруженные несколько месяцев, но всё это ока…
  5. Sep 3, 2024Andrew Ng про цену LLM инференса За последний год цена на лучшую модель OpenAI уменьшилась…
  6. Jul 31, 2024У нас тут в Ex-Human появилась классная вакансия на Senior NLP инженера ⚡ https://botifyai…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →