🧠 مدلهای Multimodal چطور همزمان متن، تصویر و صدا را میفهمند؟
بیشتر سیستمهای یادگیری ماشین فقط روی یک نوع داده کار میکنند:
📄 متن
🖼 تصویر
🎧 صدا
اما مدلهای Multimodal LLM یا MLLM این مرز را از بین بردهاند.
این مدلها میتوانند همزمان:
📷 تصویر
🎥 ویدئو
🎙 فایل صوتی
و متن را دریافت و تحلیل کنند.
ساختار اصلی یک MLLM از ۳ بخش تشکیل میشود:
👁 Encoder → تبدیل تصویر/صدا به داده قابل فهم
🧠 LLM → بخش استدلال و تولید زبان
🔗 Connector → مترجم بین داده تصویری و مدل زبانی
در واقع Connector دادههای تصویری را به token تبدیل میکند تا مدل زبانی بتواند آنها را پردازش کند.
این مدلها طی ۳ مرحله آموزش میبینند:
1️⃣ Pre-training
2️⃣ Instruction tuning
3️⃣ Alignment tuning
و با تکنیکهایی مثل RLHF و DPO برای رفتار ایمنتر و پاسخهای بهتر تنظیم میشوند.
البته هنوز مشکل «Hallucination» وجود دارد؛
یعنی مدل ممکن است:
❌ چیزی را ببیند که وجود ندارد
❌ ویژگیها را اشتباه توصیف کند
❌ یا رابطه بین اشیا را اشتباه بفهمد
📡 کانال آقای هوش مصنوعی
🆔 @MrArtificialintelligence
#MachineLearning #DeepLearning #Multimodal
Post #5117
2.24K

- 👏 4
- ❤ 3