🔉 Meta SAM Audio: Segment Anything Model Audio
SAM Audio — это “Segment Anything”, но для звука: foundation-модель, которая выделяет любой целевой звук (separation) из микса по промпту (текстом) или по отдельным объектам из видео!
Что может модель:
— Аудио сепарация: целевой объект (человек, машина, инструмент) + все остальное (бэкграунд, шум, пространство, реверберация и эхо)
— Visual prompting: можно привязать звук к объекту на кадре (маской/объектом в видео) и отделять “звук этого объекта” от остальных.
— Span prompting: задаёшь временные якоря, где звук есть/нет и модель сама определяет “что именно считать целевым”.
💻 github + модель SAM Audio
👄 Есть демо: можно потыкать по этой ссылке
Post #712
31
Forwarded from Мишин Лернинг