HyperParallel-MoE - Huawei пытается выжать MoE из железа Ascend по-взрослому 👀
Появилась работа про HyperParallel-MoE - систему планирования обучения MoE-моделей, заточенную специально под Ascend A3.
Проблема в том, что у Ascend A3 есть разные блоки под разные типы работы:
- AIC - матричные вычисления
- AIV - векторные операции и коммуникации
Но стандартный MoE-пайплайн всё равно часто гоняет Dispatch, GMM, SwiGLU и Combine как последовательные full-device kernels. В итоге часть железа простаивает: то заняты матричные блоки, то коммуникационные, но нормального tile-level overlap нет.
HyperParallel-MoE решает это через статический heterogeneous taskflow для MoE-FFN:
- AIC обрабатывает GMM tiles
- AIV берёт на себя vector + communication tiles
- зависимости контролируются через event counters
- AIV-driven one-sided communication убирает host-side collective barriers
- весь объединённый taskflow ведёт один kernel
На DeepSeek-style MoE-моделях заявлены такие результаты:
- 1.49-1.58x снижение latency на участке Dispatch-to-Combine MoE-FFN при balanced routing
- 1.08-1.09x ускорение end-to-end training при sampled natural routing
- интеграция в MindSpore / MindFormers
- переиспользование уже оптимизированных операторов
Не «пусть компилятор как-нибудь разрулит», а явное разделение работы между матричными, векторными и коммуникационными блоками.
Huawei строит не только чипы, но и полный софтверный стек вокруг них. А такие штуки показывают, что гонка ИИ-железа будет всё больше решаться не только терафлопсами, но и тем, насколько глубоко фреймворк умеет использовать конкретную архитектуру.
Paper: https://arxiv.org/abs/2605.23764
Post #1854
1.75K

- ❤ 3