Открытая MoE-видеомодель MAGI-2 Preview от Sand.ai
Разработчики из Sand.ai выложили в открытый доступ веса и код инференса MAGI-2 Preview. Модель построена на single-stream архитектуре и генерирует 10-секундные ролики сразу вместе с синхронной аудиодорожкой.
Внутри применили редкий для таких моделей fine-grained MoE. При суммарном объеме в 114B параметров на каждый токен активируется всего 6B. По объему вычислений на шаг это в разы легче плотного MiniMax H3 (33B), благодаря чему стоимость инференса упала в ~10 раз, а модель заскочила на 6 место в лидерборде Artificial Analysis.
Сам пайплайн генерации двухстадийный. Сначала базовая модель генерирует видео в низком разрешении, а затем refiner апскейлит результат до 1080p.
Пока это не конкурент MiniMax H3 в плане локальной доступности. Квантованный H3 влезает в одну карту на 24GB (RTX 3090/4090), тогда как для MAGI-2 нужно заметно больше ресурсов. Зато у облачных провайдеров за счет всего 6B активных параметров инференс по API будет значительно дешевле dense моделей, да и у такой архитектуры хороший потенциал для скейлинга.
Техрепорт
Код
Веса
@ai_newz
Post #638
225
Forwarded from эйай ньюз

