На первом месте трендов Hugging Face сейчас DiffusionGemma от Google, первая крупная открытая диффузионная языковая модель. Она генерирует текст не по токену слева направо, а блоками по 256 токенов сразу: начинает с зашумлённой заготовки и за несколько шагов очищает её целиком, попутно исправляя слабые места. Отсюда скорость, больше 1000 токенов в секунду на H100, в 4-6 раз быстрее обычной Gemma 4.
Внутри MoE на 25,2B параметров с 3,8B активных, контекст 256K, на вход принимает текст, картинки и видео. За скорость платим качеством: на reasoning-бенчах модель уступает обычной Gemma 4 на 5-20 пунктов, Google сама советует её для черновиков, инфилла кода и структурированной генерации, а не для продакшена. Квантованная версия влезает в 18 ГБ видеопамяти, GGUF уже лежат, но поддержка в llama.cpp пока на стадии PR.
Лицензия Apache 2.0, vLLM поддерживает с первого дня. Смотреть на неё стоит не как на замену чат-моделям, а как на первую серьёзную пробу новой парадигмы: если подход приживётся, локальные модели станут в разы быстрее.
@neuro_channel
Post #2445
1.7K
- 👍 7
- 🔥 2
- 👏 1