حالا این مدل اومده با حذف فول اتنشن و ترکیب 39 لایه لوکال با 9 لایه اسپارس، و فعالسازی فقط 5 درصد وزنها در هر کلمه ،
هزینه پردازش مثلا یه متن 1 میلیون توکنی رو از سطح یه غول چند صد میلیاردی به سطح یه مدل یک بیستم ارزون تر رسونده.
اینش جالبه که تونستن دیوار KV Cache رو دور بزنن
Post #4241
16
بازه باز مثلا در کانتکست 1 میلیون توکن، مشکل اصلی فقط پردازش نیست، بلکه نگهداشتن تاریخچه چت ها در حافظه موقت یا همون KV Cache عه که معمولا صدها گیگ کارت گرافیک میخواد.
- ❤ 1
- 👍 1