🧠 «Яндекс» открыл новую ИИ-модель: 80 млрд параметров, но в работе только 3 млрд
«Яндекс» выложил в открытый доступ Alice AI Foundation LLM – претрейн-версию новой большой языковой модели, которую, по информации компании, обучили полностью с нуля без весов сторонних open source-моделей.
Самое интересное здесь – архитектура Mixture of Experts. В модели 80 млрд параметров, но при обработке запроса активны только около 3 млрд. Поэтому для инференса ей нужно заметно меньше вычислительных ресурсов, чем можно было бы ожидать от модели такого размера.
При этом на тестах она вполне может потягаться с моделями покрупнее. Например, в задачах программирования Alice AI Foundation LLM обошла Nvidia Nemotron-3-Super-120B-Base, а в тестах на фактические знания – более крупную DeepSeek-V4-Flash-Base с 284 млрд параметров. В математических олимпиадных задачах модель поделила лидерство с Qwen3.5-35B-A3B-Base.
Отдельная история – проверка знаний именно на русском. Для этого «Яндекс» сделал два собственных бенчмарка: WikiWebFacts и HardMultiQA. Они проверяют не только обычные факты и даты, но и более редкие темы: например, право, медицину, IT и искусство.
Обучали модель на 18 трлн токенов, а веса открыли под лицензией Apache 2.0, поэтому использовать модель можно и в исследованиях, и в коммерческих проектах.
Post #1883
474

- 👍 8
- 😁 4
- 👏 2
- 🔥 1