Первая open-source end-to-end unified multimodal model.
SenseTime выпустила SenseNova-U1 - мультимодальную модель, которая объединяет понимание, рассуждение и генерацию в одной непрерывной системе.
Большинство мультимодальных моделей либо понимают изображения, либо генерируют изображения. Обычно это разные инструменты, сшитые вместе. SenseNova-U1 умеет делать и то, и другое нативно, в рамках одной архитектуры.
Главная инновация - архитектура NEO-Unify. Она убирает и visual encoder, и variational autoencoder. Всё происходит в едином пространстве представлений.
Что это открывает:
• Native interleaved reasoning - модель может генерировать изображения прямо в процессе рассуждения, а не через отдельные tool calls. То есть она способна решать задачи, создавая визуальные промежуточные шаги нативно.
• Сильная генерация инфографики - сложные PPT-слайды, постеры, диаграммы с высокой плотностью информации. Единое понимание и генерация делают модель особенно сильной в структурированных визуалах.
• SOTA-производительность - модель показывает state-of-the-art результаты среди open-source моделей как на benchmark’ах понимания, так и генерации.
Выпущены две модели:
• SenseNova-U1-8B-MoT - dense-модель на 8B параметров
• SenseNova-U1-A3B-MoT - MoE-модель на 38B параметров с 3B активных
Обе модели доступны в open source на GitHub и Hugging Face.
Почему это важно: современные мультимодальные системы часто используют adapters, чтобы переводить данные между разными модальностями. SenseNova-U1 работает с языком и зрением нативно. Понимание и генерация используют одно и то же пространство представлений.
Благодаря этому модель может понимать сложные визуальные материалы и генерировать структурированную инфографику без переключения между разными системами.
Модель полностью open source.
Model Weights: https://huggingface.co/collections/sensenova/sensenova-u1
Github Repo: https://github.com/OpenSenseNova/SenseNova-U1
Post #1411
1.54K

- ❤ 8
- 🔥 2