Что: Осенний open source дамп: суверенная MoE-модель от Яндекса, рассуждающий гигант от Xiaomi и другие
Ссылки: AliceAI-Foundation-80B-A3B-Base, MiMo-V2.6-Pro-RL, NVIDIA Nemotron-3-Diarization, Qwen-Image-2.1-GGUF
Почему интересно: очередная порция открытых релизов на все случа жизни.
AliceAI-Foundation-80B-A3B-Base - базовая модель Яндекса, обученная полностью с нуля. Теперь точно суверенная! Большой пост про неё есть на Хабре в блоге компании. 80 млрд общих параметров, 3 млрд активных, гибридная архитектура с KDA (Kernelized Differential Attention) и Gated Attention, контекст 262 тыс. токенов, лицензирование Apache 2.0. Обучена на 18 трлн токенов (это существенно меньше, чем у многих конкурентов - тех же Qwen3.5 и DeepSeek V4, что может сказаться на широте знаний за пределами русского языка) с применением Muon. На русскоязычных фактических бенчмарках WikiWebFacts и HardMultiQA модель заметно опережает Qwen3.5-35B, GLM-4.5-Air и Nemotron-3-Super-120B, хотя использует вчетверо меньше активных параметров. Вместе с весами новой LLM Яндекс открыл эти два своих бенчмарка, на которых модель тах хорошо себя показала 🙂 Стоит отметить, что для практического использования модель нужно дообучать или применять SFT.
MiMo-V2.6-Pro-RL - главный китайский релиз недели. Xiaomi выложила разреженную MoE-модель на 1.02 трлн общих параметров с 42 млрд активных, нативным мультимодальным входом (текст, изображение, видео, аудио) и контекстом в 1 млн токенов. На бенчмарках Code Agent DeepSWE v1.1 она набирает 71.9 против 74 у Claude Opus 5, а в Artificial Analysis Intelligence Index обходит Kimi K3 и Qwen3.8 Max, занимая первое место среди открытых релизов. Главная особенность в смешанном RL для кода, агентов, визуальных задач и кибербезопасности в одном прогоне, а не отдельными тренировками под каждый домен. Лицензия MIT, что приятно, но размер в 570+ Гб даже в 4-битной квантизации резко сужает круг возможных интересантов. Кроме того, в официальном разборе от Xiaomi отмечается, что модель при агентных сценариях иногда циклически повторяет одинаковые вызовы инструментов, сжигая контекст и время (например, 0.54% для Pro в OpenCode).
NVIDIA Nemotron-3-Diarization - компактная модель на 100 млн параметров для определения кто говорит и когда. Поддерживает до восьми спикеров, работает в потоковом режиме с задержкой от 80 миллисекунд и в офлайн-режиме. На лидерборде Voice Arena Diarization-Bench занимает 1 место с DER 14.72%. Лицензия OpenMDW 1.1 разрешает коммерческое использование. Модель возвращает только временные метки и спикеров без транскрипции, что делает её дополнением к ASR-модели, но не заменой. Поиграться с демо можно по отдельной ссылке.
Наконец, энтузиасты уже успели портировать новую визуальную модель Qwen-Image-2.1 в формат GGUF для локального запуска. Доступны версии от 7.6 до 4 ГБ. Вместе с трансформером идут текстовый энкодер на 8 млрд параметров и VAE. Полностью расцензуренная версия ещё в разработке, но в репозитории уже есть аблитирированные варианты текстового энкодера (Heretic).
#eng #llm #xiaomi #yandex #nvidia #alibaba #qwen #gguf #диаризация #opensource #moe #ии
Post #616
58