Модели обучают на корпусе ClimbMix. Для замеров берут стандартные бенчи из lm-eval-harness.
Для QAT используется рецепт из QuEST (Адамаровы вращения + стохастическое округление).
Без квантизации лучшие результаты на меньших моделях выдает SOAP 🧼, а остальных - Muon. Для PTQ в большинстве случаев Shampoo выходит победителем. В QAT режиме нет однозначного победителя, но на больших моделях будто бы “средство для мытья головы” снова предпочтителен.
Для разных моделей фитируют коэффициент эффективного размера ρ в законе;
L = A / (N · ρ)^α + BВ соответствии с результатами выше, он наибольший у Shampoo и наименьший у Muon. Adam следующий по хорошести.
💡 Выводы
Довольно интересный и практически полезный результат учитывая растущие потребности в получении качественных низкобитных результат. Интересно, обобщаются ли полученные выводы на другие битности (более высокие или низкие), и соотношения размера обучающих данных к размеру модели (много Шиншилл). Станет ли это мотивацией для более пристального внимания к Shampoo или оверхед на внедрение и настройку перебьет потенциальные бенефиты 🤔?