JetBrains выпустила в опенсорс Mellum-2, свою первую, как они сами говорят, «серьёзную» языковую модель. Раньше Mellum был узким помощником под автодополнение прямо в IDE, а теперь это целое семейство полноценных LLM под код и агентов. Команда под руководством Никиты Павличенко собирала её полгода.
Сегодня конкретно Mellum2-12B-A2.5B-Thinking добралась до топа HF, в понедельник когда я делал обзор меллум только появился, но вот дополз до зоны внимания.
Внутри модели MoE на 12 миллиардов параметров, из которых активны только 2,5 миллиарда, 64 эксперта и 8 включаются на каждый токен. За счёт этого по скорости и цене модель ведёт себя как совсем маленькая, а знаний держит как большая. Предобучали на 11 триллионах токенов, дообучали через RLVR, обучение с проверяемой наградой: модель поощряют, только когда результат реально проходит проверку, код компилируется и тесты зелёные. Контекст 131к токенов, есть варианты Base, Instruct и Thinking. На кодовых бенчмарках вроде LiveCodeBench и EvalPlus держится прилично для своего размера, плюс умеет вызывать инструменты, без чего агентские сценарии не живут.
Главное, что всё это лежит под Apache 2.0. Это не «только для исследований», как у многих свежих открытых моделей, а нормальная свободная лицензия: можно тащить в коммерческий продукт и дообучать под себя.
@neuro_channel
Post #2426
2.31K

- ❤ 9
- 🆒 3
- 😇 2