SenseNova-U1: мультимодальная модель без привычной «склейки» зрения и языка
SenseNova-U1 вышла на ModelScope под Apache 2.0. Это native multimodal модель, которая объединяет понимание и генерацию в одной архитектуре.
Внутри NEO-Unify: без visual encoder и без VAE. Вместо отдельной обработки картинки и текста модель работает с языком и визуальными данными как с единым end-to-end представлением.
На практике одна модель закрывает сразу несколько задач: text-to-image, редактирование изображений, interleaved generation и visual QA.
Заявлены две версии: 8B-MoT dense и A3B-MoT MoE. По словам разработчиков, SenseNova-U1 показывает SOTA на open-source бенчмарках для понимания и генерации.
https://modelscope.cn/models/SenseNova/SenseNova-U1
Post #3314
1.96K

- ❤ 3
- 👍 1
- 🔥 1