Топ трендов HuggingFace за неделю — разбираем, что нового
TL;DR
Новое: Gemma 4 12B — мультимодалка Google без отдельных энкодеров. Ideogram 4 — картинки с заказом по строгой структуре и сильным текстом. HRM-Text-1B — берёт глубиной обдумывания, а не размером. Nemotron 3.5 ASR — распознавание речи на лету, 40 языков с русским. Higgs Audio v3 и MisoTTS — разговорная речь с эмоциями и клонированием голоса. Cosmos 3 — модели мира NVIDIA для роботов. Bernini-R — видео от ByteDance.
Держится: DeepSeek V4 Pro, Step-3.7-Flash, PaddleOCR-VL-1.6, Qwen3.6 Uncensored.
LLM
HRM-Text-1B от Sapient. Модель на 1B, интересна устройством: внутри два блока крутят данные по кругу, и текст прокручивается много раз, словно модель продолжает над ним думать. Обычная нейросеть проходит свои слои всего раз. При крошечном размере эта берёт глубиной обдумывания, а не шириной. Apache 2.0, 164K загрузок.
Mellum-2 от JetBrains, первая серьёзная открытая модель команды под код и агентов, на неделе дополз до топа. Подробно разбирал в отдельном посте.
Nemotron 3 Ultra от NVIDIA, открытый фронтир на 550B под рассуждения и агентов, контекст миллион токенов. Разбор был отдельно.
LFM2.5-8B-A1B от Liquid AI, лёгкая локальная модель, закрепилась в трендах. Писал про неё пару недель назад.
Мультимодал и зрение
Gemma 4 12B от Google. У модели нет отдельного блока-энкодера для картинок и звука, она принимает их напрямую: меньше задержка, проще запуск. Понимает текст, картинки, аудио и видео, контекст 256K, есть режим рассуждений и вызов функций. По бенчмаркам прилично для 12B. Apache 2.0, 554K загрузок, плюс GGUF от Unsloth под домашнее железо.
LocateAnything-3B от NVIDIA, находит объекты на картинке по описанию, за неделю вышла на первое место в трендах. Подробный разбор в отдельном посте.
Изображения
Ideogram 4 от Ideogram AI, первая открытая модель компании. Картинку можно заказать строгой структурой, а не просто фразой, прописать где какой элемент, цвета и стиль. Лучший в классе текст внутри картинки, логотипы и вывески читаемы. До 2048×2048, первое место среди открытых на Design Arena. Лицензия некоммерческая, аккуратнее с продажей результата. fp8 и nf4 это сжатые сборки под обычные видеокарты.
Аудио
Nemotron 3.5 ASR Streaming от NVIDIA. Распознавание речи на лету, всего 0,6B. Фишка в плотности, на одной H100 тянет около 240 говорящих разом против 14 у Parakeet. 40 языков с автоопределением, русский в основном наборе. Коммерция разрешена.
Higgs Audio v3 от Boson AI, синтез речи на 4B под голосовых агентов. Клонирует голос без дообучения, эмоции и стиль задаются прямо в тексте. Не читает, а разговаривает, 102 языка с русским, задержка около 600 мс. Лицензия некоммерческая.
MisoTTS от MisoLabs, 8B, форк Sesame CSM. Под живую эмоциональную диалоговую речь, подхватывает интонацию по образцу звука и клонирует голос с короткой записи. Задержка всего 110 мс, есть водяной знак на речь. Пока только английский. Модифицированный MIT.
Видео и модели мира
Cosmos 3 от NVIDIA, семейство моделей мира для физического ИИ. Одна модель понимает и создаёт текст, картинки, видео, звук и траектории движения роботов. Главный смысл в том, что обучение роботов на придуманных моделью сценах сокращается с месяцев до дней. Видео до 720p со звуком. Nano на 16B легче, Super на 64B даёт максимум качества. Открытая лицензия.
Bernini-R от ByteDance, генерация и редактирование видео поверх Wan2.2. Подход сначала пойми, потом нарисуй, модель разбирает инструкцию, исходное видео и образцы, строит план, и только потом собирает кадры. По тестам ByteDance редактирование на уровне закрытых моделей. Apache 2.0.
Держится в топе
DeepSeek V4 Pro — 5,4M загрузок, флагман с контекстом в миллион токенов, после постоянной скидки стоит копейки. Qwen3.6-35B-A3B Uncensored — 3,04M, расцензуренная версия. Step-3.7-Flash — мультимодальная MoE от StepFun, до 400 токенов в секунду. PaddleOCR-VL-1.6 — снова первая в парсинге документов.
Хорошей недели! 👾
@neuro_channel
Post #2427
2.17K
- ❤ 8
- 👏 4
- 👍 3