На Hugging Face появилась локальная Muse Glimmer 30B
В репозитории Muse Glimmer 30B представлена как мультимодальная агентная модель с GGUF-сборками для llama.cpp. Версия размером около 17 ГБ рассчитана на системы с 24 ГБ видеопамяти, динамическая K-quant — с 32 ГБ.
Для обработки изображений нужен отдельный perception encoder, а DFlash-драфтер предназначен для speculative decoding. Авторы карточки заявляют до 233,4 токена/с на RTX 5090 против 74,9 без DFlash, но это внутренний замер при greedy decoding и batch size 1.
В карточке авторами названа Meta Superintelligence Lab, однако официальная связь репозитория и аккаунта в X с Meta пока не подтверждена.
Источник: оригинальная публикация
CLODEx
Post #251
520
