TGViewer
آقای هوش مصنوعی آقای هوش مصنوعی @mrartificialintelligence · 20.7K subscribers
Post #5117 2.24K
🧠 مدل‌های Multimodal چطور همزمان متن، تصویر و صدا را می‌فهمند؟

بیشتر سیستم‌های یادگیری ماشین فقط روی یک نوع داده کار می‌کنند:
📄 متن
🖼 تصویر
🎧 صدا

اما مدل‌های Multimodal LLM یا MLLM این مرز را از بین برده‌اند.
این مدل‌ها می‌توانند همزمان:
📷 تصویر
🎥 ویدئو
🎙 فایل صوتی
و متن را دریافت و تحلیل کنند.

ساختار اصلی یک MLLM از ۳ بخش تشکیل می‌شود:

👁 Encoder → تبدیل تصویر/صدا به داده قابل فهم
🧠 LLM → بخش استدلال و تولید زبان
🔗 Connector → مترجم بین داده تصویری و مدل زبانی

در واقع Connector داده‌های تصویری را به token تبدیل می‌کند تا مدل زبانی بتواند آن‌ها را پردازش کند.

این مدل‌ها طی ۳ مرحله آموزش می‌بینند:
1️⃣ Pre-training
2️⃣ Instruction tuning
3️⃣ Alignment tuning

و با تکنیک‌هایی مثل RLHF و DPO برای رفتار ایمن‌تر و پاسخ‌های بهتر تنظیم می‌شوند.

البته هنوز مشکل «Hallucination» وجود دارد؛
یعنی مدل ممکن است:
❌ چیزی را ببیند که وجود ندارد
❌ ویژگی‌ها را اشتباه توصیف کند
❌ یا رابطه بین اشیا را اشتباه بفهمد

📡 کانال آقای هوش مصنوعی
🆔 @MrArtificialintelligence

#MachineLearning #DeepLearning #Multimodal
  • 👏 4
  • ❤ 3
More from @mrartificialintelligence
  1. Oct 1, 2026⚠️ آیا برای کنترل هوش مصنوعی دیر شده است؟ سیستم‌های هوش مصنوعی با سرعت زیادی در حال توانمن…
  2. Oct 1, 2026❤️‍🩹 حقیقت نگران‌کننده درباره عاشق‌شدن به هوش مصنوعی آیا یک هوش مصنوعی واقعاً می‌تواند عا…
  3. Oct 1, 2026🎙️ «فرزندان خودت را چطور برای دنیایی که با هوش مصنوعی بزرگ می‌شود آماده می‌کنی؟» این یکی…
  4. Oct 1, 2026🤖 جنسن هوانگ: هوش مصنوعی در حال خروج از صفحه‌نمایش و ورود به دنیای فیزیکی است نسل اول AI…
  5. Sep 30, 2026🔬 بینایی ماشین در کنترل کیفیت فولاد؛ از دیدن عیب تا مکان‌یابی آن در خطوط تولید فولاد، همه…
  6. Sep 30, 2026💼 اگر می‌خواهید کارکنان به ساخت ابزارهای هوش مصنوعی کمک کنند، باید در موفقیت آن سهم داشته…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →