TGViewer
NoteCasts NoteCasts @navidcasts · 159 subscribers
Post #33 147
Audio
👉 @navidcasts 🎓

Video models are zero-shot learners and reasoners

این متن علمی با این فرض که مدل‌های ویدیویی در حال تبدیل شدن به مدل‌های بنیادین عمومی برای بینایی ماشین هستند، همان نقشی را ایفا می‌کنند که مدل‌های زبان بزرگ (LLM) برای پردازش زبان طبیعی ایفا کردند.


👉 @navidcasts 🎓

نویسندگان نشان می‌دهند که مدل Veo 3 توانایی‌های شگفت‌انگیز یادگیری و استدلال صفر-مرحله‌ای (zero-shot) را در طیف گسترده‌ای از وظایف بصری از ادراک (مانند تشخیص لبه و تقسیم‌بندی) تا مدل‌سازی فیزیکی و دستکاری صحنه از خود نشان می‌دهد.


این توانایی‌های نوظهور، به ویژه قابلیت "زنجیره فریم‌ها" (Chain-of-Frames یا CoF) که معادل بصری استدلال گام به گام در LLMهاست، نشان‌دهنده پیشرفت سریع مدل‌های ویدیویی به سمت تبدیل شدن به یک مدل عام‌گرا برای درک بصری است. این تحقیق استدلال می‌کند که با وجود عملکرد ضعیف‌تر در مقابل مدل‌های تخصصی، سیر تکاملی مدل‌های ویدیویی، آینده بینایی ماشین را به سمت معماری‌های واحد و عمومی هدایت خواهد کرد.
  • ❤ 4
  • ❤‍🔥 2
  • 🥰 2
More from @navidcasts
  1. Sep 23, 2026https://youtu.be/mPr2iboMI5A?si=Ac5iAx4lstOBPfoz
  2. Sep 21, 2026هشدار امنیتی مشترک نهادهای اطلاعاتی بریتانیا، آمریکا و هلند نشان می‌دهد که عاملان سایبری و…
  3. Sep 18, 2026این منبع یک مقاله پژوهشی تخصصی است که روشی نوآورانه برای شناسایی دقیق پارامترهای مودال ساز…
  4. Sep 7, 2026این مقاله، با شروعی بر مبنای ماجرای پرحاشیه کیتی جنوویس، به تحلیل چرایی عدم مداخله افراد د…
  5. Sep 6, 2026این مقاله استدلال می‌کند که دموکراسی لیبرال در معرض خطر جدی است زیرا حامیان آن در بازگو کر…
  6. Jul 6, 2026این وویس به معرفی و تبیین مهندسی عامل (Agent Engineering) می‌پردازد و آن را به عنوان یک نظ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →