یه مدل open-source که ایدهی معروف Segment Anything رو آورده تو دنیای صدا. یعنی همون کاری که SAM با تصویر میکرد، حالا برای صدا انجام میده.
پیش از این audio separation وجود داشت، ولی بیشتر مدلها خیلی محدود بودن؛ یا فقط speech رو جدا میکردن، یا فقط آهنگ هارو و معمولاً هم فقط یه راه کنترل داشتن.
اما SAM Audio اجازه میده از یه فایل صدا یا حتی ویدیو هر صدایی رو که بخوای جدا کنی؛ با text prompt، با یه visual click روی تصویر، یا با مشخص کردن یه time span که خیلی چیز خفنیه
فنی
مدل SAM Audio از یه flow-matching Diffusion Transformer استفاده میکنه. یه مدل generative که کمکم از روی noise، صدای تمیز رو بازسازی میکنه. بعد هم صدا رو compress میکنه بدون اینکه کیفیت از بین بره.
نحوه استفاده
کد open-source رو با Python 3.10+ نصب کن
و model checkpointها رو از Hugging Face بگیر
برای performance واقعی، inference رو روی CUDA GPU اجرا کن
حتما سایتشو چک کنید
🔵Telegram
