Топ трендов HuggingFace за неделю — что приехало в опенсорс
TL;DR
Новое: Spark-X2.5 — 4 млрд параметров с миллионом токенов контекста для агентов на слабом железе, K2-Horizon-MoVA-36B от MBZUAI, TimesFM 3.0 для прогноза временных рядов, VDN-H3 — MiniMax-H3, который генерирует видео быстрее, чем оно идёт, неравномерные кванты Qwen3.8-27B от ISTA и GLM-5.3 со снятыми отказами для пентеста.
Держится: Qwen3.8-27B и её кванты, Qwen3.8-Flash-Next, GLM-5.3 и GLM-5.3-Flash, DeepSeek V4 Flash со зрением, LTX-2.5, MiniMax-H3, Breeze TTS 2.
LLM и агенты
Spark-X2.5-4B — небольшая модель для агентов с длинным контекстом. При 4 млрд параметров держит миллион токенов: на каждый слой с полным вниманием приходится три со скользящим окном, что сдерживает рост кэша. Обучена на 20 трлн токенов на кластерах Huawei Ascend, поддерживает 200 языков, лицензия Apache 2.0. На τ³-bench набирает 30,4 против 9,3 у Qwen3.5-9B, в остальном идёт вровень с моделями своего размера. Есть версия на 1,7 млрд, пощупать можно в демо.
K2-Horizon-MoVA-36B-A4B — разреженная модель для работы в том числе с терминалом из семейства K2 Horizon, про которое писал в субботу. У неё 36 млрд параметров, 4 млрд активных, контекст 512 тысяч токенов, лицензия Apache 2.0. Из шести моделей семейства в топ попала она: в терминальных задачах обходит Nemotron 3 Ultra, который в 15 раз больше. Авторы обещают выложить промежуточные чекпоинты, данные и код обучения.
Прогнозы
TimesFM 3.0 — модель Google для прогноза временных рядов: продаж, нагрузки, трафика. Третья версия научилась прогнозировать несколько связанных рядов сразу и держит первое место на fev-bench и GIFT-Eval. Лицензия разрешает только некоммерческое использование, код на GitHub.
Видео
VDN-H3 — ускоренная версия MiniMax-H3 для генерации видео со звуком. К основной сети добавили линейную ветку внимания по кадрам и два небольших LoRA-адаптера, веса H3 сохранили. Ролик на 14,4 секунды генерируется за 11 секунд на восьми B200 — быстрее, чем воспроизводится. Открыли веса, код обучения и инференса.
Кванты и сообщество
Qwen3.8-27B-GSQ-RCO-GGUF — кванты Qwen3.8-27B от лаборатории DASLab из австрийского ISTA для заданного размера файла. Точность каждого тензора подбирают градиентным поиском. Сборка на 3,5 бита весит 11,8 ГБ вместо 53,8 ГБ в BF16 без потерь на AIME25 и LiveCodeBench. Это обычные GGUF, работают в llama.cpp, Ollama и LM Studio.
GLM-5.3-CYBERSECURITY-FP8 — версия GLM-5.3 для задач наступательной безопасности: эксплойтов, реверса, фишинга, разбора малвари. Отказы сняли правкой весов, без файнтюна и LoRA. Грузится в vLLM как есть, требует восемь H200.
Файнтюн Qwen3.8-27B от DavidAU с названием на десять слов обещает рассуждения в 2–10 раз короче оригинала при том же качестве.
Классика
В топ вернулись эмбеддинги all-MiniLM-L6-v2 с 251 млн загрузок, GPT-2 для генерации текста и MMS-300m для распознавания речи на тысяче с лишним языков.
Держится в топе
Qwen3.8-27B с 6,4 млн загрузок и GGUF от Unsloth за 10 млн, Qwen3.8-Flash-Next с GGUF, GLM-5.3 и GLM-5.3-Flash, DeepSeek-V4-Flash-Vision-Exp, видеомодели LTX-2.5 и MiniMax-H3, синтез речи Breeze TTS 2.
Хорошей недели! 👾
@neuro_channel
Post #2840
1.9K
- 👍 10
- ❤ 5
- ⚡ 3