برای مثال، زمانی که یک متن طولانی رو به یک مدل هوش مصنوعی میدیم، مدل میتونه به طور دقیق به سوالات در نیمهی اول متن پاسخ بده، اما در نیمهی دوم شروع به گفتن مطالب بی ربط یا نامفهوم میکنه. این مسئله تصادفی نیست. مطالعات اخیر نشون دادن که مدلهای بزرگ فعلی در پردازش متون طولانی با افت عملکرد قابلتوجهی مواجه میشن و این افت در مدلهای مختلف در نقاط متفاوتی رخ میده، برخی مدلها در هنگام خواندن صفحه دهم یه کتاب عملکردشون به طور چشمگیری کاهش میابه، در حالیکه برخی دیگه تا صفحهی صدم دوام میارن.
علت اصلی این کاهش عملکرد، نقصهای ذاتی در معماری ترنسفورمر (Transformer) سنتی هست.
ترنسفورمر با انباشتن لایه ها سعی در افزایش توانایی مدل دارن، اما این روش باعث میشه منابع محاسباتی بدون توجه به میزان پیچیدگی هر توکن به طور یکنواخت تخصیص یابن. توکنهای ساده (مانند حروف ربط و فعلهای کمکی) و توکنهای پیچیده (مانند اصطلاحات تخصصی و جملات بلند) به یک اندازه پردازش میشن، که این امر منجر به محاسبات زائد زیادی میشه.
در عین حال، مکانیزم (KV Cache) در مواجهه با متون طولانی حجم زیادی از حافظه رو اشغال میکنه و این موضوع نیز کارایی مدل رو بیشتر محدود میکنه.
Post #4144
3.41K
Tensorflow(@CVision) معماری جدید گوگل برای غلبه بر محدودیت های جدی معماری Transformer با سرعت دو برابری در استدلال و کاهش ۵۰ درصدی پارامتر ها در حوزه هوش مصنوعی، از همون ابتدا مدلهای زبانی بزرگ به دلیل مشکل بزرگ و کند بودن مورد انتقاد بودن. با وجود افزایش بی وقفه تعداد پارامترها،…
- 👍 9
- ❤ 2
- 👌 1