Претрейн Alice AI Foundation LLM померили в сравнении с конкурентами. Главное:
🟢 Архитектура MoE: всего 80 млрд параметров, но в моменте активны только 3 млрд. Поэтому модель быстрая и экономная по железу;
🟢 В задачах, где нужны широкие фактические знания, превосходит DeepSeek. А прошлую Alice AI LLM 235B со всемеро большим числом активных параметров побеждает в 75% фактологических вопросов;
🟢 Особенно сильна в русском языке, литературе, истории, медицине и праве, а длинный контекст до 256K держит на уровне DeepSeek;
🟢 Лицензия Apache 2.0, так что модель можно спокойно тащить и в коммерческие продукты, и в исследования.
Отдельно порадовали инженерные хаки: оптимизация хранения промежуточных данных срезала расход видеопамяти в три раза, а система предфильтров сократила вычисления на отбор датасета в десятки раз. Раньше на это уходило больше 200 тысяч GPU-часов.
И это только экспериментальная версия, на которой Яндекс обкатывает архитектуру для будущей единой рассуждающей модели Алисы AI 👍
@xor_journal
