Alice AI Foundation: что Яндекс открыл вместе с весами модели
21 сентября Яндекс опубликовал AliceAI-Foundation-80B-A3B-Base под лицензией Apache 2.0. Модель обучена с нуля, без весов сторонней LLM.
В модели 48 слоёв.
Часть вычислений выполняют MoE-слои (*mixture of experts*). Вместо одного большого блока в них работают множество небольших «экспертов». Для каждого фрагмента текста модель выбирает 10 из 512 и добавляет один общий. Так разные фрагменты проходят через разные части сети.
Для работы с контекстом чередуются два механизма внимания. Kimi Delta Attention сворачивает историю в состояние фиксированного размера, снижая расход памяти на длинных текстах. Полное внимание позволяет напрямую обращаться к предыдущим фрагментам. Заявленный предел контекста — 262 144 токена.
Это всё ещё базовая модель: финальную настройку на диалог она не проходила.
Модель получила 86,5 балла на WikiWebFacts против 83,2 у DeepSeek-V4-Flash-Base.
Источники: [модель ] · [отчёт Яндекса]
Post #156
26

- ❤ 1