👉 @navidcasts 🎓
Video models are zero-shot learners and reasoners
این متن علمی با این فرض که مدلهای ویدیویی در حال تبدیل شدن به مدلهای بنیادین عمومی برای بینایی ماشین هستند، همان نقشی را ایفا میکنند که مدلهای زبان بزرگ (LLM) برای پردازش زبان طبیعی ایفا کردند.
👉 @navidcasts 🎓
نویسندگان نشان میدهند که مدل Veo 3 تواناییهای شگفتانگیز یادگیری و استدلال صفر-مرحلهای (zero-shot) را در طیف گستردهای از وظایف بصری از ادراک (مانند تشخیص لبه و تقسیمبندی) تا مدلسازی فیزیکی و دستکاری صحنه از خود نشان میدهد.
این تواناییهای نوظهور، به ویژه قابلیت "زنجیره فریمها" (Chain-of-Frames یا CoF) که معادل بصری استدلال گام به گام در LLMهاست، نشاندهنده پیشرفت سریع مدلهای ویدیویی به سمت تبدیل شدن به یک مدل عامگرا برای درک بصری است. این تحقیق استدلال میکند که با وجود عملکرد ضعیفتر در مقابل مدلهای تخصصی، سیر تکاملی مدلهای ویدیویی، آینده بینایی ماشین را به سمت معماریهای واحد و عمومی هدایت خواهد کرد.
Post #33
147
Audio
- ❤ 4
- ❤🔥 2
- 🥰 2