Топ трендов HuggingFace за неделю — что приехало в опенсорс
TL;DR
Новое: веса GLM-5.3 и мультимодальной GLM-5.3-Flash, превью архитектуры Qwen4 под именем Qwen3.8-Flash-Next, Hy4 preview от Tencent, зрячая DeepSeek V4 Flash, синтез речи Breeze TTS 2, PhoneLLM для голосовых агентов на телефоне и Thomson от Thomson Reuters — модель для юристов и журналистов.
Держится: Qwen3.8-27B со свитой квантов, LTX-2.5, MiniMax-H3.
LLM и агенты
GLM-5.3 — старшая модель линейки GLM, веса наконец в открытом доступе. При релизе Z․ai впервые задержала их ради проверки на безопасность, обещала выложить через две недели и уложилась в срок. MoE на 743 млрд параметров, контекст миллион токенов, лицензия своя. Разбирал при выходе, пощупать можно в чате Z․ai.
GLM-5.3-Flash — мультимодальная облегчённая версия, топ по цена/качество для кодинга сейчас: 320 млрд параметров, 18 активных, миллион контекста, MIT. Писал на неделе про саму модель и про кванты Unsloth, с которыми она запускается дома от 100 ГБ памяти. Напомню, если подписку будете брать, то берите по моей ссылке, будет скидка.
Qwen3.8-Flash-Next — превью того, на чём будет построен Qwen4: 6 млрд активных из 125 плюс 51 млрд N-gram-эмбеддингов, обучение примерно в девять раз дешевле Qwen3.7-Plus при сопоставимом уровне. Разбирал в день релиза; рядом в топе висят FP8-версия и GGUF.
Hy4 preview — большая открытая модель Tencent под Apache 2.0: в терминальных задачах встала вровень с GLM-5.3 и Kimi K3. 770 млрд параметров, 49 активных, писал в четверг.
DeepSeek-V4-Flash-Vision-Exp — быстрая модель DeepSeek, которая теперь ещё и видит; веса тоже под MIT. В API она появилась ещё 21 августа, разбирал: на мультимодальных агентных задачах приближается к Opus 4.8, по тексту ничего не теряет.
Thomson-1.0-Small — модель Thomson Reuters для работы юристов, налоговиков и журналистов. Собрана продолженным обучением поверх открытой Qwen3.6-35B-A3B: десятилетия новостей, контрактов и судебной практики из архивов компании превратили в обучающие данные. Интересна как прецедент: модель уровня лучших в своей области за 35 тысяч GPU-часов — такое по силам не только гигантам. Лицензия только некоммерческая.
Голос
Breeze TTS 2 — синтез речи для реального времени, первое место среди открытых моделей в рейтинге Artificial Analysis. Голос можно склонировать с образца, а можно просто описать словами; смех, вздохи и покашливания ставятся пометками прямо в тексте. Первый звук через 40 мс на H100, для запуска хватает видеокарты на 12 ГБ. Английский и китайский, лицензия некоммерческая.
PhoneLLM — модель для голосовых агентов на телефоне от команды Pipecat: заточена звать инструменты вовремя и не говорить «столик забронировал», не забронировав. Файнтюн NVIDIA Nemotron 3 Nano на 30 млрд параметров при 3,5 активных. По замерам авторов держится на уровне GPT 5.6 Terra при цене на 94% ниже и ответе на 1,3 секунды быстрее. BSD, коммерция без ограничений, язык только английский.
Видео
FastH3 4-step — дистилл MiniMax-H3 от FastVideo: видео со звуком за четыре прохода трансформера вместо полного набора шагов. Обучали без единого примера, чистой дистилляцией DMD2 на разреженном внимании. Сложное движение пока хуже оригинала, зато считает в разы быстрее.
Кванты и сообщество
Расцензуренные сборки Qwen3.8-27B занимают четыре строки топа, 2,4 млн загрузок суммарно, а GGUF от Unsloth перевалил за 9 млн.
Держится в топе
Qwen3.8-27B с 4,7 млн загрузок, видеомодель со звуком LTX-2.5 и MiniMax-H3, которая не уходит из топа с конца июля.
Хорошей недели! 👾
@neuro_channel
Post #2787
2.15K
- ❤ 5
- 🔥 4
- 👍 2