👋 Всем привет, на связи служба качества претрейна Alice AI. Мы опубликовали веса нашей новой модели
AliceAI‑Foundation-80B‑A3B‑Base под лицензией Apache 2.0. Её создание — ещё один шаг к нашей единой рассуждающей модели (ЕРМ), на базе которой будут развиваться агентские возможности Алисы AI.🆖 Путь к результату претрейна был долог и тернист. Например, предсказанные по
scaling laws гиперпараметры обучения оказались неоптимальными из-за низкой корреляции loss-а на отложенной выборке с качеством на целевых метриках. После пересчёта гиперпараметров по scaling laws обучение «взорвалось»: MoE‑активации начали расти, а затем резко подскочил loss. Пришлось разбираться, ошиблись ли мы с прогнозом или новые гиперпараметры выявили проблему в процессе обучения. Рецепт аугментаций, который помогал при инициализации из опенсорс‑моделей, надо было переработать для более длинного претрейна. А обучения сложным рассуждениям оказалось недостаточно для агентских навыков: когда мы добавили взаимодействия с инструментами уже в претрейн, это улучшило агентские бенчмарки в посттрейне.
↔️ За итоговыми скорами стоит много экспериментов, и нам хочется рассказать о них подробно. Поэтому вместе с весами мы публикуем большой технический отчёт на Хабре: от пайплайнов подготовки данных и протоколов оценки до стабилизации обучения и scaling laws.
В статье мы разобрали:
⚪️ Как Z-loss на выходных активациях MoE остановил взрыв loss без потери качества и просадки скорости
⚪️ Почему точность ранжирования моделей по loss на случайном датасете оказалась всего 42 % (и как удалось поднять её до 94 %)
⚪️ Чем Kimi Delta Attention в связке с Attention Residuals лучше Gated DeltaNet из Qwen3-Next на бенчмарках
⚪️ Как мы вдвое сократили время шага оптимизатора, когда переходили на Muon
Подписывайтесь:
💬 @Yandex4ML
📹 @YandexML
