اینو اگر جایی شنیدین بهشون Large Multimodal Model
هم میگن
که به اختصار میشه LMM
یعنی اینکه هوش مصنوعی دیگه فقط محدود به یک جنس داده نیست و میتونه همزمان چند فرمت مختلف مثل متن، عکس، ویدیو و صدا رو بفهمه، تحلیل کنه و تحویل بده.
تا قبل از مدلهای چندوجهی، اکثر سیستمها تکوجهی بودن؛ یعنی مثلاً یک مدل فقط متن میفهمید، یکی دیگه فقط عکس میساخت. اما یک مدل چندوجهی مثل انسانی میمونه که همزمان میبینه، میشنوه و صحبت میکنه.
دو تا چیز هست که اونارو نسبت به LLM ها متمایز میکنه :
- مدل میفهمه که صدای ضربه باید با تصویر برخورد دو شیء هماهنگ باشه، یا حرکتی که توی ویدیو میبینید از نظر فیزیکی با صدایی که میشنوید جور دربیاد.
- بهجای اینکه برای تبدیل متن به عکس یک مدل استفاده کنید و برای صداگذاری یک مدل دیگه، تمام این پردازشها توی یک مدل یکپارچه انجام میشه.
@codehalics | کدهالیک
Post #889
569
کدهالیک | codehalic چندوجهی
- 👍 4