Открываем AliceAI-Foundation-80B-A3B-Base — новую языковую модель Яндекса, обученную с нуля
Около полугода работы, 80 млрд параметров, из которых активны 3 млрд, 17,5 трлн токенов на основной стадии обучения. AliceAI-Foundation-80B-A3B-Base полностью обучена в Яндексе с нуля, без весов сторонних опенсорс-моделей. За это время команда пересобрала корпус, перебрала архитектурные решения, подобрала гиперпараметры и добавила данные для рассуждений и агентских взаимодействий.
Один из самых напряжённых эпизодов начался после пересчёта гиперпараметров по scaling laws. Сначала стали расти MoE-активации, затем резко подскочил loss. Первой гипотезой была ошибка в прогнозе, но тот же эффект удалось воспроизвести на небольшой модели из нескольких широких слоёв. Команда нашла способ стабилизировать обучение, вернулась к предсказанному learning rate и успешно обучила финальную модель.
И таких развилок в работе было много. Разработчики примерно вдвое ускорили распределённый шаг оптимизатора, в десятки раз сократили вычисления при отборе фактологических документов и провели отдельную стадию претрейна для развития рассуждений и агентских навыков. В итоговых замерах модель обходит более крупные DeepSeek-V4-Flash-Base и Nemotron-3-Super на многих задачах, а на IMO AnswerBench и LiveCodeBench лидирует среди сравниваемых открытых претрейнов.
Какие эксперименты сработали, от каких пришлось отказаться и как модель дошла до финального чекпойнта.
Post #69588
9.55K

- ❤ 51
- 🤮 42
- 👍 32
- 💩 9
- 👎 6
- ❤🔥 3
- 😁 3
- 🤔 3
- 🥱 3
- 🤝 3
- 😎 2