7 апреля на Artificial Analysis Video Arena без анонсов, пресс-релизов и корпоративного бэкграунда появилась модель HappyHorse-1.0, которая сразу заняла 1 место.
🟢В категории text-to-video без аудио она обошла Seedance 2.0.
🟢В image-to-video без аудио рейтинг ещё выше - 1391–1406 Elo, это новый абсолютный максимум арены.
🟠В треке с аудио HappyHorse идет второй, уступая только Seedance 2.0.
🟡Команда, которая стоит за моделью официально не раскрыта.
Все, что известно о внутреннем устройстве, собрано из описаний на happyhorse-ai.com (домен, кстати зарегистрирован 7 апреля).
Заявлено 15 млрд. параметров и 40-слойный трансформер, обрабатывающий текстовые, визуальные и аудио-токены в единой последовательности, без перекрестного внимания и без отдельных подсетей под каждую модальность.
Инференс идет за 8 шагов без CFG, с ускорением через собственный компилятор MagiCompiler.
Пятисекундный ролик в 1080p, по данным авторов, рендерится примерно за 38 секунд на H100.
Поддерживается совместная генерация видео и синхронного аудио с липсинком на 7 языках, включая китайский, английский, японский и кантонский. GitHub и Model Hub помечены как
coming soon. 🟡Вокруг авторства в сети идет активное расследование.
Одна версия связывает HappyHorse с Alibaba: в пользу этого играет название (2026 - год Лошади по китайскому календарю).
Издание The Information ссылаясь на 2 источника, эту версию подтвердило.
Другая - указывает на Tongyi Lab и линейку Wan, однако технические описания HappyHorse и недавно вышедшей Wan 2.7 расходятся: Wan 2.7 делает акцент на ризонинге и длинном тексте, тогда как HappyHorse строится вокруг однопоточного трансформера и 8-шагового инференса.
Третья версия, набирающая вес в техническом сообществе, строится на сходстве HappyHorse с открытой моделью daVinci-MagiHuman от SandАi, вышедшей в марте: совпадают метрики визуального качества, следования промту, физической консистентности и WER голоса.
Если релиз состоится на условиях open source с коммерческой лицензией, как следует из описания на сайте модели, это станет первым случаем, когда открытая видеомодель обошла закрытых лидеров в пользовательских слепых тестах.
@ai_machinelearning_big_data
#news #ai #ml



