Топ трендов HuggingFace за неделю — что приехало в опенсорс
TL;DRНовое: Spark-X2.5 — 4 млрд параметров с миллионом токенов контекста для агентов на слабом железе, K2-Horizon-MoVA-36B от MBZUAI, TimesFM 3.0 для прогноза временных рядов, VDN-H3 — MiniMax-H3, который генерирует видео быстрее, чем оно идёт, неравномерные кванты Qwen3.8-27B от ISTA и GLM-5.3 со снятыми отказами для пентеста.
Держится: Qwen3.8-27B и её кванты, Qwen3.8-Flash-Next, GLM-5.3 и GLM-5.3-Flash, DeepSeek V4 Flash со зрением, LTX-2.5, MiniMax-H3, Breeze TTS 2.LLM и агентыSpark-X2.5-4B — небольшая модель для агентов с длинным контекстом. При 4 млрд параметров держит миллион токенов: на каждый слой с полным вниманием приходится три со скользящим окном, что сдерживает рост кэша. Обучена на 20 трлн токенов на кластерах Huawei Ascend, поддерживает 200 языков, лицензия Apache 2.0. На τ³-bench набирает 30,4 против 9,3 у Qwen3.5-9B, в остальном идёт вровень с моделями своего размера. Есть версия на
1,7 млрд,
пощупать можно в демо.
K2-Horizon-MoVA-36B-A4B — разреженная модель для работы в том числе с терминалом из семейства K2 Horizon, про которое
писал в субботу. У неё 36 млрд параметров, 4 млрд активных, контекст 512 тысяч токенов, лицензия Apache 2.0. Из шести моделей семейства в топ попала она: в терминальных задачах обходит Nemotron 3 Ultra, который в 15 раз больше. Авторы обещают выложить промежуточные чекпоинты, данные и код обучения.
ПрогнозыTimesFM 3.0 — модель Google для прогноза временных рядов: продаж, нагрузки, трафика. Третья версия научилась прогнозировать несколько связанных рядов сразу и держит первое место на fev-bench и GIFT-Eval. Лицензия разрешает только некоммерческое использование,
код на GitHub.
ВидеоVDN-H3 — ускоренная версия MiniMax-H3 для генерации видео со звуком. К основной сети добавили линейную ветку внимания по кадрам и два небольших LoRA-адаптера, веса H3 сохранили. Ролик на 14,4 секунды генерируется за 11 секунд на восьми B200 — быстрее, чем воспроизводится. Открыли веса, код обучения и инференса.
Кванты и сообществоQwen3.8-27B-GSQ-RCO-GGUF — кванты Qwen3.8-27B от лаборатории DASLab из австрийского ISTA для заданного размера файла. Точность каждого тензора подбирают градиентным поиском. Сборка на 3,5 бита весит 11,8 ГБ вместо 53,8 ГБ в BF16 без потерь на AIME25 и LiveCodeBench. Это обычные GGUF, работают в llama.cpp, Ollama и LM Studio.
GLM-5.3-CYBERSECURITY-FP8 — версия GLM-5.3 для задач наступательной безопасности: эксплойтов, реверса, фишинга, разбора малвари. Отказы сняли правкой весов, без файнтюна и LoRA. Грузится в vLLM как есть, требует восемь H200.
Файнтюн Qwen3.8-27B от DavidAU с названием на десять слов обещает рассуждения в 2–10 раз короче оригинала при том же качестве.
КлассикаВ топ вернулись эмбеддинги
all-MiniLM-L6-v2 с 251 млн загрузок,
GPT-2 для генерации текста и
MMS-300m для распознавания речи на тысяче с лишним языков.
Держится в топеQwen3.8-27B с 6,4 млн загрузок и GGUF от Unsloth за 10 млн,
Qwen3.8-Flash-Next с GGUF,
GLM-5.3 и
GLM-5.3-Flash,
DeepSeek-V4-Flash-Vision-Exp, видеомодели
LTX-2.5 и
MiniMax-H3, синтез речи
Breeze TTS 2.
Хорошей недели! 👾
@neuro_channel