TGViewer
کارگروه علم داده کارگروه علم داده @dsfum · 429 subscribers
Post #737 180

Forwarded from آقای هوش مصنوعی

🧠 مدل‌های Multimodal چطور همزمان متن، تصویر و صدا را می‌فهمند؟

بیشتر سیستم‌های یادگیری ماشین فقط روی یک نوع داده کار می‌کنند:
📄 متن
🖼 تصویر
🎧 صدا

اما مدل‌های Multimodal LLM یا MLLM این مرز را از بین برده‌اند.
این مدل‌ها می‌توانند همزمان:
📷 تصویر
🎥 ویدئو
🎙 فایل صوتی
و متن را دریافت و تحلیل کنند.

ساختار اصلی یک MLLM از ۳ بخش تشکیل می‌شود:

👁 Encoder → تبدیل تصویر/صدا به داده قابل فهم
🧠 LLM → بخش استدلال و تولید زبان
🔗 Connector → مترجم بین داده تصویری و مدل زبانی

در واقع Connector داده‌های تصویری را به token تبدیل می‌کند تا مدل زبانی بتواند آن‌ها را پردازش کند.

این مدل‌ها طی ۳ مرحله آموزش می‌بینند:
1️⃣ Pre-training
2️⃣ Instruction tuning
3️⃣ Alignment tuning

و با تکنیک‌هایی مثل RLHF و DPO برای رفتار ایمن‌تر و پاسخ‌های بهتر تنظیم می‌شوند.

البته هنوز مشکل «Hallucination» وجود دارد؛
یعنی مدل ممکن است:
❌ چیزی را ببیند که وجود ندارد
❌ ویژگی‌ها را اشتباه توصیف کند
❌ یا رابطه بین اشیا را اشتباه بفهمد

📡 کانال آقای هوش مصنوعی
🆔 @MrArtificialintelligence

#MachineLearning #DeepLearning #Multimodal
More from @dsfum
  1. Sep 22, 2026می‌دونید تفاوت Jev با LLM‌های عادی چیه؟ تفاوت اصلی اینه که Jev اصلاً برای تولید متن ساخته…
  2. Sep 22, 2026روز پیش یه مدل جدید معرفی شد به اسم Jev برخلاف LLM های معمولی که برای گفتگو و تولید متن سا…
  3. Sep 15, 2026🔶#استخدام تحلیلگر داده در کالاصنعتی(فعال در زمینه پمپ و موتور و ابزارآلات صنعتی) 🌐لینک آ…
  4. Sep 13, 2026🧠 مشکل Black Box در هوش مصنوعی چیست؟ مدل‌های هوش مصنوعی می‌توانند پیش‌بینی‌های بسیار دقیق…
  5. Sep 8, 2026همکاری غیرمجاز و خودسرانه میان عامل‌های هوش مصنوعی (AI Swarm) در OpenAI در ژوئیه ۲۰۲۶، در…
  6. Sep 6, 2026📊 پشت هر تصمیم مهم، یک داستان از دلِ داده‌ها پنهان شده است... اما داده‌ها به‌تنهایی حرف ن…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →