TGViewer
КПД КПД @quant_prune_distill · 3.48K subscribers
Post #830 2.21K
Оптимизация

Учат в основном через Muon. Для голов attention используется headwise Muon, который отдельно оптимизирует головы, потому что так лучше. Учить Engram через Adam накладно по памяти. Поэтому вместо этого предлагают Синкхорн-сбалансированные обновления параметров с моментом. Это позволяет не хранить тяжеловесные статистики Адама для Engram и вроде сходится хорошо.

🎭 Ещё следует отметить мультимодальную балансировку. Ибо обучаем сразу на данных как текстовой, так и картиночной/видео-природы — экспертов учат нужным образом балансировать активность.

🧪 Эксперименты

Учат всё хозяйство на 45T токенов на претрейне. ViT-модуль сначала отдельно, а потом совместно. На RL-стадии используют как реальные собранные задачи и human feedback, так и синтетические, сгенерированные самой же моделью. Разные reasoning effort учатся с разными length penalty, убывающими экспоненциально от силы effort.

Потом ещё гоняют On-Policy Distillation (OPD) поверх 40 учителей-специалистов на разных доменах.

📊 По метрикам DeepSeek-V4.1-Flash заметно опережает предшественницу, а также нередко оказывается лучше Pro-версии. На задачах по кодингу / агентским сценариям якобы тягается местами с Sol и Фаблой.

Выводы

Выдающаяся инженерная работа. Сложно сказать, всё ли это самим им пришло в голову или тут уже агенты многое додумали за них. Впечатляет фантастически малый размер KV-кэша — менее гигабайта на миллион токенов, что выглядит просто как сказка. Действительно ли этого объёма хватает на все практически интересные сценарии? Ну и модель реально быстрая.
  • ❤ 14
  • 👍 2
More from @quant_prune_distill
  1. Oct 1, 2026🛠 Метод Типичный scaling law имеет вид: L(N, D) = A N^α + B D^β + c 🔄 Скейлинг по рекурс…
  2. Oct 1, 2026Scaling Laws for Looped Mixture of Experts 📄 Статья Есть MoE, которые как-то скейлятся (п…
  3. Sep 29, 2026⚙️ Метод На префилле имеем дело с тяжёлыми матричными умножениями, поэтому для ускорения ц…
  4. Sep 29, 2026🧩 Disaggregated Quantization: Specializing LLM Prefill and Decode 📄 Статья Обычно для пр…
  5. Sep 24, 2026Метрики, которые мы заслужили. Карточка модели на лицехватс
  6. Sep 23, 2026🛠️ Метод Авторы предлагают довольно интересную схему генерации негативного условия: - 📝…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →