Pretraining Large Language Models with NVFP4
[Статья][PR в Transformer Engine]
Введение
На днях команда из одной зеленой компании выкатила технический отчет про обучение в NVFP мамбы-хуямбы гибридной трансформер-мамбы модели на довольно солидном масштабе - 10Т токенов и 12B параметров.
За последний год вышла не одна статья про обучение в FP4 (вот, вот и вот). Но все то было на масштабах на порядки меньше по данным и размерам моделей. И вполне закономерный вопрос - остаются ли рабочими предложенные идеи для моделей, хоть сколь либо интересным на практике.
И ребята, скомбинировав идеи из прошлых статей, смогли получить рецепт близкий по скорости сходимости к FP8.
Post #551
1.96K

- 😁 4
- 👀 2
- 🔥 1