Компания JetBrains представила открытую модель Mellum2.1 под лицензией Apache 2.0, ориентированную на использование в составе кодинг-агентов, быстрых субагентов и локальных пайплайнов разработки. Архитектурно модель сохранила параметры предыдущей версии, оставаясь компактной смесью экспертов (MoE) общим объемом 12 млрд параметров, из которых активны 2,5 млрд.
Основной фокус обновления пришелся на этап пост-трейнинга, где обучение с подкреплением (RL) стало ключевой фазой вместо короткой финальной доводки. Команда развернула масштабную инфраструктуру для симуляции реального окружения, выполнив миллионы запусков в изолированных песочницах на тысячах инстансов. В датасеты вошли задачи по разработке ПО, олимпиадному программированию, математике, вызову инструментов и естественным наукам, причем все открытые и внутренние данные прошли жесткую фильтрацию на предмет корректности тестов и верифицируемости результатов. Благодаря этому модель научилась ориентироваться внутри репозитория, изменять файлы и самостоятельно проверять внесенные правки.
На бенчмарках Mellum2.1 демонстрирует заметный качественный рывок в агентном кодинге по сравнению с Mellum2, а также уверенный рост в рассуждениях, вызове инструментов и решении комплексных задач, выступая наравне с открытыми аналогами вроде Qwen3.5-9B и Gemma 4 E4B.
С точки зрения скорости и вычислительной эффективности модель сохраняет легкость своего класса, а механизм multi-token prediction (MTP) ускоряет генерацию одиночных запросов примерно в 1,6 раза. Под высокой нагрузкой на одном ускорителе H200 модель выдает почти вдвое больше токенов в секунду, чем сопоставимые монолитные решения.
Веса Mellum2.1 уже опубликованы на Hugging Face для свободного использования и самостоятельного хостинга, а в ближайшее время JetBrains планирует выпустить GGUF-сборки для llama.cpp, Ollama и LM Studio, а также голову для спекулятивного декодирования через MTP в vLLM.
Post #1403
193

- 🔥 3