Оптимизация
Учат в основном через Muon. Для голов attention используется headwise Muon, который отдельно оптимизирует головы, потому что так лучше. Учить Engram через Adam накладно по памяти. Поэтому вместо этого предлагают Синкхорн-сбалансированные обновления параметров с моментом. Это позволяет не хранить тяжеловесные статистики Адама для Engram и вроде сходится хорошо.
🎭 Ещё следует отметить мультимодальную балансировку. Ибо обучаем сразу на данных как текстовой, так и картиночной/видео-природы — экспертов учат нужным образом балансировать активность.
🧪 Эксперименты
Учат всё хозяйство на 45T токенов на претрейне. ViT-модуль сначала отдельно, а потом совместно. На RL-стадии используют как реальные собранные задачи и human feedback, так и синтетические, сгенерированные самой же моделью. Разные reasoning effort учатся с разными length penalty, убывающими экспоненциально от силы effort.
Потом ещё гоняют On-Policy Distillation (OPD) поверх 40 учителей-специалистов на разных доменах.
📊 По метрикам DeepSeek-V4.1-Flash заметно опережает предшественницу, а также нередко оказывается лучше Pro-версии. На задачах по кодингу / агентским сценариям якобы тягается местами с Sol и Фаблой.
Выводы
Выдающаяся инженерная работа. Сложно сказать, всё ли это самим им пришло в голову или тут уже агенты многое додумали за них. Впечатляет фантастически малый размер KV-кэша — менее гигабайта на миллион токенов, что выглядит просто как сказка. Действительно ли этого объёма хватает на все практически интересные сценарии? Ну и модель реально быстрая.
Post #830
2.21K
- ❤ 14
- 👍 2