Трек выше сгенерирован моделью, которую выпустили на этой неделе. Одна фраза, ни одной настройки:
Smooth jazz lounge, a smoky female voice, warm brass stabs and a swinging piano trio, a classy late-night lounge mood, around 82 BPM.
Голос тоже машинный. Это не живая певица и не клонированный тембр реального человека — модель синтезирует вокал вместе с музыкой, в один приём.
И в этом вся суть. Обычный генератор собирает песню конвейером: одна модель пишет слова, вторая — мелодию, третья натягивает поверх синтезированный голос. Каждая не знает, что сделали остальные. Отсюда знакомые болячки: ударение падает мимо доли, вокал звучит механически, припев будто из другой песни.
HappyShrimp планирует всё сразу — и рассыпаться на стыках просто нечему, стыков нет. А дальше начинается умолчание. Архитектуру не раскрыли — ни статьи, ни технического отчёта. Партнёром объявили Taihe Music Group, но покрывает ли сделка лицензии на записи, компания не ответила. На чём обучали модель — тоже.
И вот что еще любопытно. У Alibaba была открытая музыкальная линия — InspireMusic под Apache-2.0: аудио-токенизатор, трансформер на Qwen2.5, flow-matching до 48 кГц, документация до последнего слоя. Только вышла она в феврале 2025-го, выложены одни инструментальные модели, а версия с вокалом полтора года числится «в планах».
С тех пор аудио-команда Alibaba выпустила распознавание речи, синтез речи, голосовые агенты — а музыку не трогала. Пока не появился HappyShrimp. Закрытый, без весов, без техотчёта, зато с вокалом и партнёром-лейблом.
Открытость закончилась ровно там, где начались голоса живых артистов. Совпадение вряд ли.
🎵 happyshrimp.ai — бесплатные кредиты новым
⚙️ github.com/FunAudioLLM/InspireMusic — без лимитов, на своём железе