برای حل این مشکلات، پژوهشگران به طور فعال در دو مسیر مختلف تحقیق میکنن:
یکی افزایش بهره وری از پارامترها از طریق «اشتراک وزنها»، و دوم اختصاص پویا (دینامیک) منابع محاسباتی بر اساس میزان پیچیدگی ورودی، تا بتوان به نوعی «پردازش تطبیقی» دست پیدا کنه.
این معماری MoR (Mixture of Routing) به طور هوشمندانه این دو ایده رو با هم ترکیب کرده و مسیر تازهای رو برای توسعه مدلهای زبانی بزرگ گشوده.
اول اشتراک پارامترها:
در مدلهای معمولی، هر لایه مجموعهی مستقلی از پارامترها دارن که باعث افزایش حجم مدل میشه. اما با اشتراک گذاری پارامترها بین لایهها، میشه همون عملکرد رو با تعداد کمتری از پارامترها حفظ کرد. این کار باعث کاهش حافظه مورد نیاز و ساده تر شدن آموزش مدل میشه. MoR این ویژگی را از معماری های Recursive Transformer (ترنسفورمر بازگشتی) به ارث میبره، یعنی مدل چندین بار از یک بلوک ترنسفورمری تکرارشونده استفاده میکنه.
دوم محاسبه تطبیقی:
بهجای اینکه همهی توکنها (کلمات یا نشانهها) بهصورت مساوی پردازش شن، در این رویکرد مدل بر اساس پیچیدگی هر توکن تصمیم میگیره چقدر منابع محاسباتی به اون اختصاص بده. مثلاً ممکنه واژهای ساده مثل "and" خیلی سریع پردازش شه، اما عبارتی پیچیده یا تخصصی مثل "quantum entanglement" نیاز به پردازش عمیق تری داشته باشه.
سوم مسیردهی پویا در سطح توکن:
در این بخش از MoR، مدل بهصورت پویا تصمیم میگیره که هر توکن در کدام مسیر یا زیرشبکه (subnetwork) پردازش شه. این ایده شبیه به مفهوم Mixture of Experts هست، ولی در MoR به جای انتخاب بین چند "کارشناس" مجزا، مسیرهای محاسباتی با بازدهی بالا و اشتراکی در سطح توکنها طراحی شدن.
و مهمترین بخش چهارم معماری همافزا!
ترکیب این دو ویژگی (اشتراک پارامتر و محاسبه تطبیقی) در قالب یک فریم ورک واحد، باعث شده MoR یک معماری «همافزا» باشه؛ یعنی این دو رویکرد نهتنها تداخلی با هم ندارن، بلکه عملکرد یکدیگر رو تقویت می کنن
Post #4145
3.92K
Tensorflow(@CVision) برای مثال، زمانی که یک متن طولانی رو به یک مدل هوش مصنوعی میدیم، مدل میتونه به طور دقیق به سوالات در نیمهی اول متن پاسخ بده، اما در نیمهی دوم شروع به گفتن مطالب بی ربط یا نامفهوم میکنه. این مسئله تصادفی نیست. مطالعات اخیر نشون دادن که مدلهای بزرگ فعلی…
- ❤ 8
- 👍 4