👋 Всем привет, на связи служба качества претрейна Alice AI. Мы опубликовали веса нашей новой модели
AliceAI‑Foundation-80B‑A3B‑Base под лицензией Apache 2.0. Её создание — ещё один шаг к нашей единой рассуждающей модели (ЕРМ), на базе которой будут развиваться агентские (и не только) возможности Алисы AI.🏮В претрейн‑замерах новая модель обходит более крупные
DeepSeek‑V4-Flash‑Base и Nemotron-3-Super на многих задачах: от фактологических и экспертных вопросов до математики и кода. А на сложных тасках IMO AnswerBench и LiveCodeBench лидирует среди сравниваемых открытых претрейнов. Нашу предыдущую закрытую
Alice AI LLM 235B она превосходит по фактологическим знаниям, математике, программированию и работе с длинным контекстом — при почти втрое меньшем общем числе параметров и примерно в семь раз меньшем числе активных.⏯ За итоговыми скорами стоит много экспериментов, и нам хочется рассказать о них подробно. Поэтому вместе с весами мы публикуем большой технический отчёт на Хабре: от пайплайнов подготовки данных и методов оценки до стабилизации обучения и scaling laws.
В статье мы разобрали:
🔴 Как Z-loss на выходных активациях MoE остановил взрыв loss без потери качества и просадки скорости
🔴 Что мы делали с фактологическими текстами, чтобы модель их лучше запомнила при обучении
🔴 Как мы вдвое сократили время шага оптимизатора Muon
Подписывайтесь:
💬 @Yandex4Developers
