یه پروژه خیلی جالب از تیم Browser Use دیدم به اسم video-use که ایدهش اینه بهجای اینکه خودت بشینی ساعتها ویدیو ادیت کنی، به یه Coding Agent میگی این ویدیو رو ادیت کن و Agent خودش فرآیند ادیت رو انجام میده.
جالبتر اینکه AI قرار نیست کل ویدیو رو فریمبهفریم ببینه. اول ویدیو رو به Transcript، timestamp کلمهها، اطلاعات صدا و ساختار زمانی تبدیل میکنه و از این اطلاعات برای تصمیمگیری درباره کات ها و بخشهای مختلف استفاده میکنه.
بعد میتونه filler word ها و مکثهای اضافه رو حذف کنه، چند take رو با هم ترکیب کنه، subtitle بسازه، color grading انجام بده و حتی برای بخشهایی animation و motion graphic تولید کنه؛ در نهایت هم با FFmpeg خروجی میگیره و خودش خروجی رو بررسی میکنه.
به نظرم قسمت جذاب ماجرا فقط AI video editing نیست؛ بلکه اینه که ادیت ویدیو داره از یک نرمافزار GUI به یک Agentic workflow تبدیل میشه. یعنی بهجای اینکه بگی با چه ابزاری این کار رو انجام بدم؟، فقط میگی چی میخوام و Agent خودش ابزار و مراحل رسیدن بهش رو مدیریت میکنه:
github.com/browser-use/video-use
@Linuxor
Post #5119
12.3K
