TGViewer
Neurohive Neurohive @neurohive · 5.22K subscribers
Post #1977 757
Audio Audio Audio Audio Audio
🎼YuE2: открытая модель генерирует песни с редактируемой партитурой на уровне Suno v5

Команда китайских исследователей из HKUST, HKGAI и сообщества Multimodal Art Projection (M-A-P) представила YuE2-3B - открытую нейросеть для создания песен. Сначала она сочиняет композицию в виде читаемой партитуры, а потом исполняет её как готовый трек с вокалом. Партитуру можно поправить вручную или через LLM-агента и получить новую версию песни, а если снять ноты с чужой записи, модель без дообучения исполнит кавер в другом стиле. Примеры песен опубликованы на странице проекта.

Партитуру YuE2 пишет в нотации ABC: темп, размер, тональность, такты, метки куплета и припева, аккорды и ноты. Генерация идёт в три шага: партитура, затем семантические токены, затем акустические латентные представления (латенты). Для них звук делится на фреймы по 40 мс, и каждый фрейм описывается 64 числами. Семантические токены добавляют то, что неудобно записать нотами, а из латентов отдельный вариационный автоэнкодер (VAE) собирает стерео 48 кГц. Все три шага выполняет один трансформер из 28 слоёв по схеме Mixture-of-Transformers (MoT): в каждом слое два эксперта со своими весами и общим механизмом внимания.

В слепом прослушивании эксперты предпочли YuE2 песням Suno v4.5 в 57.3% сравнений против 30.5%. С Suno v5 вышла почти ничья: 40.4% против 39.9%. На бенчмарке WildSongBench у этой настройки 6.96 балла по SongBench с минимальным отрывом от ближайших конкурентов Mureka 9 (6.94) и Suno v5 (6.87). Тесты показали, что партитура делает песню лучше: с ней эксперты выбирали трек в 49.3% сравнений, без неё в 34.6%.

Веса YuE2 открыты на Hugging Face под некоммерческой лицензией CC BY-NC 4.0. Код инференса и скилл yue2-music для LLM-агентов опубликованы на GitHub. Создать песню с помощью YuE2 без установки можно в бесплатном веб-демо.

#Stateoftheart
  • 🔥 3
  • ❤ 2
  • 👍 1
More from @neurohive
  1. Sep 24, 2026RRSI: метод рекурсивного самоулучшения обвязки ИИ-агентов от Google улучшил результаты Cla…
  2. Sep 19, 2026Vidu S2: модель генерирует видео-аватары и редактирует стримы на лету в 720p при 25–42 FPS…
  3. Sep 9, 2026WorldSculpt: модель собирает 3D-сцену с сотнями отдельных объектов из видео Alaya Lab и То…
  4. Aug 31, 2026🗣 VoiceMem: фреймворк памяти для голосовых ассистентов поднимает факты из всех прошлых ди…
  5. Aug 24, 20264DAnyone: 4D-модель человека из видео, снятого одной камерой Исследователи из Zhejiang Uni…
  6. Aug 11, 2026JoyAI-Video-Edit: 16B-модель редактирует видео в реальном времени при 30 FPS в 720p на одн…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →