TGViewer
Synaptic Garden Synaptic Garden @synaptic_garden · 559 subscribers
Post #1403 193
Компания JetBrains представила открытую модель Mellum2.1 под лицензией Apache 2.0, ориентированную на использование в составе кодинг-агентов, быстрых субагентов и локальных пайплайнов разработки. Архитектурно модель сохранила параметры предыдущей версии, оставаясь компактной смесью экспертов (MoE) общим объемом 12 млрд параметров, из которых активны 2,5 млрд.

Основной фокус обновления пришелся на этап пост-трейнинга, где обучение с подкреплением (RL) стало ключевой фазой вместо короткой финальной доводки. Команда развернула масштабную инфраструктуру для симуляции реального окружения, выполнив миллионы запусков в изолированных песочницах на тысячах инстансов. В датасеты вошли задачи по разработке ПО, олимпиадному программированию, математике, вызову инструментов и естественным наукам, причем все открытые и внутренние данные прошли жесткую фильтрацию на предмет корректности тестов и верифицируемости результатов. Благодаря этому модель научилась ориентироваться внутри репозитория, изменять файлы и самостоятельно проверять внесенные правки.

На бенчмарках Mellum2.1 демонстрирует заметный качественный рывок в агентном кодинге по сравнению с Mellum2, а также уверенный рост в рассуждениях, вызове инструментов и решении комплексных задач, выступая наравне с открытыми аналогами вроде Qwen3.5-9B и Gemma 4 E4B.

С точки зрения скорости и вычислительной эффективности модель сохраняет легкость своего класса, а механизм multi-token prediction (MTP) ускоряет генерацию одиночных запросов примерно в 1,6 раза. Под высокой нагрузкой на одном ускорителе H200 модель выдает почти вдвое больше токенов в секунду, чем сопоставимые монолитные решения.

Веса Mellum2.1 уже опубликованы на Hugging Face для свободного использования и самостоятельного хостинга, а в ближайшее время JetBrains планирует выпустить GGUF-сборки для llama.cpp, Ollama и LM Studio, а также голову для спекулятивного декодирования через MTP в vLLM.
  • 🔥 3
More from @synaptic_garden
  1. Oct 9, 2026Microsoft представила Microsoft-Decision-1 — специализированную модель для быстрого принят…
  2. Oct 9, 2026В ночь с 7 на 8 октября дата-центр Яндекса в Сасово был серьезно повреждён из-за атаки БПЛ…
  3. Oct 8, 2026video post
  4. Oct 8, 2026Vidu представила новую модель генерации видео Vidu Q4 Preview, которая сразу залетела в то…
  5. Oct 8, 2026StepFun объявила неделю бесплатного доступа к модели Step 5 Preview через разных провайдер…
  6. Oct 8, 2026Anthropic начал выдавать кредиты на api пользователям платных планов
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →