TGViewer
Python/ django Python/ django @pythonl · 58.7K subscribers
Post #5428 6.12K
🚀 Open-source прорыв: PrismAudio

Вышла модель PrismAudio и она уже забирает SOTA в генерации аудио из видео (V2A)

Что важно:

- 518M модель, принята на ICLR 2026
- обходит все аналоги по качеству звука
- быстрее конкурентов: ~0.63s на инференс

Главная фишка:

модель думает не одним блоком, а разбивает задачу на 4 части:

- смысл (что происходит)
- время (когда звучит)
- эстетика (как звучит)
- пространство (где звучит)

И обучается через RL прямо внутри этого процесса

Результат:

- топ по всем метрикам (CLAP, MOS и др.)
- лучше MMAudio, ThinkSound и HunyuanVideo
- стабильно работает даже вне обучающего датасета

Плюс: выпустили новый бенчмарк AudioCanvas - 800+ сценариев со звуками

Model: https://modelscope.ai/models/iic/PrismAudio
Demo: https://modelscope.cn/studios/iic/PrismAudio
Paper: https://modelscope.ai/papers/2511.18833
GitHub: https://github.com/FunAudioLLM/ThinkSound/tree/prismaudio

🐍 Python полезные ресурсы 🚀Max

@pythonl
  • ❤ 10
  • 🔥 4
  • 👍 3
  • 😢 1
  • 🎉 1
More from @pythonl
  1. Sep 27, 2026🐍 В Python 3.15 решили мягко «похоронить» re.match() re.match() никуда не удаляют, но для…
  2. Sep 26, 2026⚡️ Qwen-Image за 6 шагов: Viggle ускорили генерацию и редактирование в 5 раз Viggle выложи…
  3. Sep 25, 2026🖥 Заголовки безопасности для FastAPI - одной строкой 🛡️ fastapi-security-headers добавля…
  4. Sep 24, 2026Линтер для инструкций ИИ-агентов LintLang проверяет AGENTS.md, CLAUDE.md, SKILL.md, описан…
  5. Sep 24, 2026‼️Ваши данные уже слиты. Вопрос лишь в том, кто и как ими воспользуется. Только в 2025 год…
  6. Sep 24, 2026⚡️ OmniVoice - открытая модель озвучки с поддержкой более 600 языков. Она умеет клонироват…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →