TGViewer
КПД КПД @quant_prune_distill · 3.49K subscribers
Post #757 1.37K
🔬 Метод

Анализ сначала проводят на dense-трансформере против nanoGPT-бейзлайна.

В качестве меры точности рассматривают SNR (signal-to-noise ratio). Как нетрудно догадаться, это отношение сигнала к шуму, и чем оно выше, тем точнее приближение.

📊 Замечают следующее: если по отдельности отслеживать ошибку квантизации весов W и активаций X в ненормализованном и нормализованном случае, то особой разницы нет. Но если рассматривать уже скалярное произведение WX, то для nGPT ошибка на 7 дБ меньше.

❓ Возникает вопрос: почему?

Авторы рассматривают числитель (сигнал) и знаменатель (шум) по отдельности. Для GPT и nGPT шум примерно одинаков, но сигнал у nGPT заметно выше. Авторы предполагают, что данный эффект вызван тем, что без нормализации для получения большого скалярного произведения достаточно иметь большой вес или активацию на данной позиции. Для nGPT же необходимы сильные корреляции между параметрами.

📈 Далее авторы строят корреляции скалярных произведений (WX) и обнаруживают, что у nGPT они действительно больше.

Кроме того, оказывается, что отношение SNR масштабируется с размерностью: чем жирнее модель, тем больше выигрыш. На типичных размерах современных моделей (hidden_dim ~ 1k–10k) отношение SNR порядка 4–6, а в пределе бесконечной размерности уходит в 14.2.

🛡️ Также проверяют прирост валидационного лосса при наложении гауссова шума, и у nGPT этот прирост в 3.5 раза меньше, чем у GPT.

🧪 Эксперименты

Сначала обучают плотные GPT/nGPT на 1.2B параметров с AdamW на 1T токенах. Сама nGPT немного лучше GPT, и просадка качества при переходе к NVFP4 у nGPT тоже заметно меньше, чем у GPT. GPT-бейзлайн использует Адамаровы вращения и per-tensor scaling.

Затем обучают маленькую MoE Mamba-hybrid модель и модель побольше. nGPT немного плохеет на первых итерациях, но затем по лоссу почти сравнивается с бейзлайном.

⚙️ Еще из приятного: learning rate для nGPT хорошо переносится с bf16-модели на NVFP4, а для GPT требуется отдельно тюнить его (ставить в 16 раз больше). Кроме того, модель устойчивее к выбору самого значения learning rate: в достаточно широком диапазоне качество не сильно страдает при уходе от оптимума.

📝 Выводы

Претрейн с нормализацией весов выглядит достаточно привлекательной идеей и несложен в реализации. Вопрос в том, насколько велик потенциальный оверхед при обучении от нормализаций. Также нет сравнения с Quartet II (полагаю, что бейзлайновый рецепт слабее).
  • ❤ 3
  • ☃ 2
  • 👍 2
More from @quant_prune_distill
  1. Oct 4, 2026"Горячие" эксперты
  2. Oct 4, 2026photo post
  3. Oct 1, 2026🛠 Метод Типичный scaling law имеет вид: L(N, D) = A N^α + B D^β + c 🔄 Скейлинг по рекурс…
  4. Oct 1, 2026Scaling Laws for Looped Mixture of Experts 📄 Статья Есть MoE, которые как-то скейлятся (п…
  5. Sep 29, 2026⚙️ Метод На префилле имеем дело с тяжёлыми матричными умножениями, поэтому для ускорения ц…
  6. Sep 29, 2026🧩 Disaggregated Quantization: Specializing LLM Prefill and Decode 📄 Статья Обычно для пр…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →