TGViewer
КПД КПД @quant_prune_distill · 3.49K subscribers
Post #590 1.9K
🧪Эксперименты

Модели обучают на корпусе ClimbMix. Для замеров берут стандартные бенчи из lm-eval-harness.

Для QAT используется рецепт из QuEST (Адамаровы вращения + стохастическое округление).

Без квантизации лучшие результаты на меньших моделях выдает SOAP 🧼, а остальных - Muon. Для PTQ в большинстве случаев Shampoo выходит победителем. В QAT режиме нет однозначного победителя, но на больших моделях будто бы “средство для мытья головы” снова предпочтителен.

Для разных моделей фитируют коэффициент эффективного размера ρ в законе;

L = A / (N · ρ)^α + B

В соответствии с результатами выше, он наибольший у Shampoo и наименьший у Muon. Adam следующий по хорошести.

💡 Выводы

Довольно интересный и практически полезный результат учитывая растущие потребности в получении качественных низкобитных результат. Интересно, обобщаются ли полученные выводы на другие битности (более высокие или низкие), и соотношения размера обучающих данных к размеру модели (много Шиншилл). Станет ли это мотивацией для более пристального внимания к Shampoo или оверхед на внедрение и настройку перебьет потенциальные бенефиты 🤔?
  • 🔥 4
More from @quant_prune_distill
  1. Oct 7, 2026А еще есть красивая демка
  2. Oct 7, 2026⚙️ Метод MMD есть мера различия между двумя распределениями P, Q. Задается некоторый полож…
  3. Oct 7, 2026🧠 Representation-Space MMD for Diffusion Language Models 📄 Статья Первое, что приходит в…
  4. Oct 7, 2026А вообще, можно энкодить все на языке brainfuck и иметь Тьюринг-полную систему.
  5. Oct 7, 2026Jev не генеративен, потому что он не выбирает следующий токен, а выбирает один из варианто…
  6. Oct 6, 2026Совпадение? Не думаю!
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →