🔬 Метод
Берут 6 оптимизаторов:
📌 AdamW
📌 PSGD
📌 Shampoo
📌 Muon
📌 Scion
📌 SOAP
и обучают семейство OLMo2-like трансформеров от 50M до 1.5B параметров Шиншилла-оптимальное количество токенов. Learning rate подобран на меньшей модели, а затем масштабируется на большие как 1 / размер.
Обучают fp16 бейзлайн и 4-х битные модели с квантизацией весов и активаций. Рассматривают PTQ (квантизацию fp16 модели) и QAT (Quantization-Aware Training).
В прошлых статьях в качестве прокси на сложность квантизации смотрели на отношение максимума по модулю к медиане (MMR) и kurtosis (4-ый момент распределения). Первая метрика показывает насколько выбросы отличаются от среднего, а вторая - “тяжесть” хвостов квантизации.
Оказывается 😱, что эти метрики не слишком коррелированны с реальной просадкой качества. Шампунь имеет большой MMR и kurtosis, но при этом обученные им модели легче всего квантизуются.
Из интересного, замечают что MMR растет с повышением learning rate, что, в целом, ожидаемо, так как у весов/активаций больше возможностей убежать от среднего. При этом MMR наименьший у Muon.
Взамен предлагают свою метрику - относительную послойную ошибку (квадрат нормы разности неквантизованной активации и квантизованную деленный на квадрат нормы первой) и показывают, что она гораздо лучше связана с результатами на бенчах.
Post #589
1.62K
- 🔥 5