Счастливая лошадь.
Я вчера с интересом следил за интригой, связанной с появлением новой видеомодели под названием HappyHorse.
Упоминания о ней появились еще 2 апреля, но вчера она вдруг обошла Seedance 2.0 на Арене в пользовательских оценках.
Принес вам несколько примеров и речерч от деда. Пишут, что хороша в мультишотах.
На мой замыленный глаз, ей довольно далеко до Сидэнского, поэтому все вопли о том, что это убийца Seedance мы пропускаем.
Но все спекулируют о том, ЧЬЯ же это модель. Спойлер: ниже расскажу что знаю.
Твитторские двигают две версии: что это новый Minimax или что это WAN 2.7 прикрутили по АПИ.
Нет.
Далее, иронии добавляет то, что в сети появилось полно фейковых сайтов типа:
happyhorses.io
http://happyhorse-ai.com
http://happy-horse.net
http://happyhorseai.net
И вот уже интернетик перепечатывает информацию оттуда про количество параметров и архитектуру.
Но.
Этой информации нет нигде, кроме как на этих фейковых сайтах.
Ссылки на гитхаб и хаггинг оттуда битые, сайты левые.
Что же это за модель?
Скорее всего это Алибаба: В составе Alibaba есть шесть основных подразделений, среди которых Qwen, Wan и Zimage - все они являются частью лаборатории Tongyi Lab, входящей в состав Alibaba Cloud, их взаимоотношения в некотором роде напоминают отношения между Amazon и AWS.
Мой ресерч говорит, что модель происходит из лаборатории Future Life Lab компании Taobao (Alibaba Group)
Проект был создан внутри подразделения ATH-AI (инновационное направление) и сейчас уже выделен в отдельную структуру.
И да, есть информация, что это будет опенсорснуто.
Вторая, менее убедительная версия, что это новый daVinci-MagiHuman или её коммерчески/прикладно оптимизированная производная. Но она не проходит проверку, потому что основана на сравнении характеристик MagiHuman и данных с фейковых сайтов.
Так что я думаю, что это Алибаба с новой моделью.
Про опенсорсность будет ждать новостей.
Пока все.
P.S.
Судя по китайским ну очень неофициальным источникам:
Тип модели: открытая мультимодальная модель для текст→видео, изображение→видео и аудио.
Схема инференса: single Transformer Transfusion, без CFG.
Шаги инференса: 8.
Видео: 720p, 24 кадра/с, длина 5 секунд.
Аудио: SFX, ambience и narration.
Языки: китайский, английский, японский, корейский, немецкий, французский.
Опенсорсность: якобы должны открыть базовую модель, distilled-версию, апскейлер и код инференса.
@cgevent
Post #15355
8.29K
- ❤ 29
- 🔥 14
- 👍 6
- 👎 3