🚀 هوش مصنوعی ۱۰ برابر حافظه کمتر مصرف میکند و تا ۷ برابر سریعتر میشود!
برخی مدلهای زبانی برای افزایش توانایی خود، بهجای استفاده از لایههای متعدد، چند لایه را بارها اجرا میکنند. به این معماریها Looped Language Models گفته میشود.
اما یک مشکل وجود دارد:
هر بار تکرار میتواند حافظه بیشتری اشغال کند و همین موضوع باعث افزایش هزینه اجرای AI و کاهش تعداد کاربرانی میشود که میتوانند همزمان از آن استفاده کنند.
حالا پژوهشگران روشی به نام Hybrid Latent Attention معرفی کردهاند که برای حل این مشکل طراحی شده است.
🧠 چطور کار میکند؟
بهجای اینکه مدل تمام اطلاعات قبلی را با جزئیات کامل در حافظه نگه دارد، اطلاعات قدیمیتر را فشرده میکند و فقط اطلاعات جدید را با جزئیات کامل حفظ میکند.
📊 نتایج بدست آمده :
🔹 ۱۰.۷ برابر کاهش مصرف حافظه بهازای هر توکن
🔹 امکان اجرای ۴ تا ۸.۸ برابر درخواست همزمان بیشتر روی یک GPU
🔹 ۲.۵ برابر افزایش سرعت در متنهای ۱۰۰۰ توکنی
🔹 تا ۷.۴ برابر افزایش سرعت در متنهای ۱۶ هزار توکنی
📌 آقای هوش مصنوعی
🔗 @MrArtificialintelligence
Post #5320
360

- ❤ 4
- 👏 3