Друзья, привет,
С началом рабочей недели вас! Я с хорошими новостями.
Яндекс открывает Alice AI Foundation LLM - собственную базовую модель, обученную с нуля, без использования готовых весов зарубежных моделей. Причём под очень удобной лицензией Apache 2.0: её можно брать за основу коммерческих и исследовательских решений.
Что внутри:
- архитектура Mixture of Experts;
- 80 млрд параметров, но при каждом запуске активны только 3 млрд (работает один эксперт), что дает более быстрый инференс и ниже стоимость работы;
- обучена на 18 трлн токенов - огромном объёме текстовых данных;
- способности к рассуждению, программированию и работе в агентных сценариях;
- открытые веса, технический отчёт и два русскоязычных бенчмарка.
Mixture of Experts (MoE) или дословно «смесь экспертов» - это архитектура нейронных сетей, в которой вместо одной большой монолитной модели используется множество специализированных мини-подсетей («экспертов») и диспетчер, который выбирает наиболее подходящих из них для каждой конкретной задачи.
По данным Яндекса (а других данных у нас пока нет), на олимпиадной математике модель делит лидерство с Qwen3.5-35B-A3B-Base. В задачах на код превосходит NVIDIA Nemotron-3-Super-120B-Base, используя в четыре раза меньше активных параметров. А в тестах на фактические знания обходит DeepSeek-V4-Flash-Base с 284 млрд параметров и 13 млрд активных.
Ждем проверок независимых экспертов на реальных задачах, длинном контексте, русском языке, коде и агентных сценариях.
🔍 Примечательно, что Яндекс открыл не только веса, но и WikiWebFacts и HardMultiQA. Первый проверяет знание дат, событий, определений и персоналий. Второй собран на основе анонимизированных запросов к Алисе AI и включает вопросы из медицины, права, IT и искусства. Опубликованы также эталонные ответы и полный протокол оценки - значит, результаты можно воспроизводить, а не просто цитировать со слайда.
Есть и менее заметная, но важная инженерная часть. Параллельная передача данных между видеокартами примерно вдвое ускорила шаги оптимизации. Каскад классификаторов сократил вычисления при подготовке обучающего корпуса в десятки раз, сохранив около 95% полезных документов. Без этого полный отбор данных потребовал бы более 200 тысяч GPU-часов.
Перед нами не «убийца мировых LLM», а более фундаментальная вещь - заявка на независимый русскоязычный стек и модель для сборки других решений. Своя базовая модель, свои данные, свои бенчмарки, открытые веса и возможность запускать всё на собственной инфраструктуре. Ну и да, видимо, у нас в России будет еще одна суверенная модель
Ссылка на модель на HuggingFace
А вы уже готовы потестировать?
#релиз
💬 ген ии | MAX
