🌐 Ai2 выложила Olmo-core 3: открытый стек для обучения MoE на триллион параметров
На этой инфраструктуре Ai2 будет обучать следующие модели Olmo. От FSDP отказались: эксперты постоянно живут на своих GPU, токены маршрутизируются к ним, а поверх работают expert parallelism, pipeline parallelism и распределённый оптимизатор.
MoE на 47B параметров на 8 B300 выдаёт 52 000 токенов в секунду на GPU, это в 2.7 раза быстрее прошлой версии. С MXFP8 добавляется ещё 21% к BF16.
Число экспертов можно поднять с 8 до 128, и throughput при этом теряет меньше 5%.
Самый крупный прогон: 1.2T параметров на 512 B300, 858 TFLOP/s на GPU.
Код открыт под Apache 2.0.
https://github.com/allenai/olmo-core
Post #5889
1.48K

- ❤ 6
- 👍 1
- 🔥 1