Модель умеет рассуждать и работать в агентных сценариях. Благодаря этому она эффективно решает сложные логические задания и справляется с программированием. Например, в решении олимпиадных задач по математике она лидирует вместе с Qwen3.5-35B-A3B-Base, справляясь с большинством заданий. В тестах на написание кода она обходит модель компании NVIDIA Nemotron-3-Super-120B-Base, хотя использует в четыре раза меньше активных параметров. Развитые способности к ризонингу и программированию нужны для эффективной работы агентов, которые выполняют задания по поручению пользователя.
Хотя у новой модели компактный размер и меньшая требовательность к вычислительным мощностям, она лучше решает задачи, где нужны широкие фактические знания, чем более крупные открытые модели. Обгоняет она в том числе DeepSeek-V4-Flash-Base с 284 миллиардами параметров и 13 миллиардами активных. Как показали бенчмарки для оценки знания фактов, новая модель отвечает так же хорошо, как предыдущая закрытая модель «Яндекса» Alice AI LLM, но у нее в три раза больше параметров и в семь раз больше активных.
Новые бенчмарки
Чтобы оценить знания модели, актуальные для русскоязычных пользователей, компания разработала два собственных бенчмарка: WikiWebFacts и HardMultiQA. Первый тест состоит из пар «короткий вопрос — короткий ответ». Он оценивает знание дат, определений, событий и персоналий. В его основу легли материалы онлайн-энциклопедий и популярные поисковые запросы.
Второй, HardMultiQA, разработали на основе анонимизированного потока запросов к «Алисе AI». Он затрагивает более редкие области знаний: от медицины и права до IT и искусства. Отвечая на эти вопросы, модель должна не просто вспомнить один факт, но и выбрать несколько правильных вариантов из списка, перечислить сразу несколько фактов, подходящих под условие вопроса, а также отыскать фактическую ошибку в тексте.
Новые бенчмарки разработали, чтобы оценить русскоязычные знания модели, поскольку англоязычные аналоги не могут проверить уровень объективно. «Яндекс» выложил оба бенчмарка в открытый доступ вместе с моделью. Благодаря этому разработчики и исследователи могут самостоятельно проверить результаты и сравнить модели. Также компания опубликовала эталонные ответы и полный протокол оценки.
Инженерные решения
Обучая модели, разработчики «Яндекса» улучшили работу оптимизатора — программы, отвечающей за процесс обучения. Теперь пересылка данных между видеокартами идет параллельно с вычислениями, что помогло примерно в два раза ускорить шаги оптимизации.
«Яндекс» также ускорил подготовку качественных обучающих данных. Чтобы отобрать нужные документы, их проверяли с помощью ресурсоемкой модели. Запуск модели на всем корпусе занял бы более 200 тысяч часов работы видеокарт. Теперь документы предварительно проходят через каскад классификаторов.
На каждом этапе более сложная и вычислительно затратная модель проверяет все меньшее число документов. Количество вычислений удалось сократить в десятки раз, сохранив около 95% полезных документов. Кроме того, инженеры сильно расширили базу знаний модели в сфере права, медицины и математики.
«Яндекс» представил новую модель под лицензией Apache 2.0. Ее можно будет свободно использовать как в исследовательских, так и в коммерческих целях. Разработчики уже завершили основной этап обучения, от которого зависят эрудированность, способности и потенциал модели. Теперь ее можно использовать как основу для создания собственных проектов.
Модель, технические отчеты и бенчмарки опубликовали на платформе Hugging Face , а техрепорт — на « Хабре ».
Post #155413
4
Лаборатория Z На экспериментальной версии Alice AI Foundation LLM «Яндекс» тестирует архитектурные решения для своей будущей единой рассуждающей модели (ЕРМ). ЕРМ станет основой для агентных возможностей «Алисы AI», с помощью которых пользователи смогут поручать ей выполнение…