همیشه دوست داشتم یه مدل به درد بخور رو لوکال بالا بیارم ولی محدودیت VRAM واقعاً روی اعصاب بود (کارت گرافیک RTX 3050 با ۶ گیگابایت حافظه VRAM )
قبلاً حتی فکر کردن به لود کردن Qwen3.6-27B روی چنین سختافزاری شبیه شوخی بود، اما نسخه 1-bit مدل جدید Bonsai 27B که کلاً ۳.۹ گیگابایت فضا میگیره رو انداختم توی LM Studio و خیلی راحت روی کارت نشست و حتی مقداری فضا برای کانتکست باقی موند...
بررسی ساختار این مدل نشون میده که چطور به این حجم رسیدن... برخلاف اکثر روشهای کوانتیزیشن رایج که فقط بخشی از وزنها رو فشرده میکنن و بخشهای حساس مثل embeddings یا attention projections رو دستنخورده میذارن، تکنولوژی Bonsai به صورت کاملاً end-to-end تمام لایهها رو فشرده میکنه... توی مدلهای معمولی اگه زیر ۴ بیت بریم مدل کلاً متلاشی میشه و رفتارهای منطقی خودش رو از دست میده، اما این پروژه وزنها رو بر پایه یک فریمورک ریاضیاتی دقیق به فرمتهای فوق فشرده تبدیل کرده... نسخه Ternary این مدل با وزنهای {-1, 0, +1} و یک اسکیل FP16 به ازای هر ۱۲۸ وزن، کلاً ۱.۷۱ بیت به ازای هر وزن مصرف میکنه (حدود ۵.۹ گیگابایت)... نسخه ۱ بیتی هم فقط از وزنهای {-1, +1} استفاده میکنه که حجم نهایی رو به ۱.۱۲۵ بیت یعنی حدود ۳.۹ گیگابایت میرسونه... این یعنی عملاً امکان اجرای یک مدل کلاس ۲۷ میلیاردی روی گوشیهای موبایل با رم محدود هم فراهم شده...
مسئله بعدی که معمولاً اجرای لوکال رو غیرممکن میکنه، حجم عظیمی هست که KV cache در کانتکستهای طولانی اشغال میکنه... خوشبختانه معماری پایه Qwen3.6 به صورت hybrid-attention طراحی شده؛ یعنی فقط ۱۶ لایه از ۶۴ لایه اون به صورت full-attention کار میکنن و بقیه لایهها ساختار linear-attention دارن که حافظه ثابتی میخواد... این باعث میشه حجم کش مدل از همان ابتدا ۴ برابر کوچکتر از مدلهای متراکم عادی باشه... علاوه بر این، مدلهای Bonsai مقاومت عجیبی در برابر کوانتیزیشن ۴ بیتی KV cache دارن... آزمایشهای forward-KL divergence نشون میده که افت کیفیت ناشی از فشردهسازی کش در این مدل بسیار کمتر از مدلهای عادیه... با فعال کردن کش ۴ بیتی، حافظه مورد نیاز برای کانتکست ۱۰۰ هزار توکنی در نسخه ۱ بیتی به حدود ۶.۸ گیگابایت کاهش پیدا میکنه که برای اجرا روی لپتاپهای معمولی فوقالعادهست...
پیادهسازی این کار به کرنلهای کاستوم نیاز داره تا سختافزار بتونه وزنهای کمبیت رو مستقیماً بدون نیاز به expand کردن در حافظه پردازش کنه... توسعهدهندهها این مسیرها رو روی MLX برای محصولات اپل و CUDA برای کارتهای انویدیا آماده کردن... همچنین برای افزایش سرعت تولید توکن، یک لایه درفت اختصاصی به اسم DSpark همراه مدل ارایه شده که به روش speculative-decoding سرعت خروجی رو روی کارتهای انویدیا تا ۳۷ درصد بیشتر میکنه... البته طبق گزارشها، سیستمهای Apple Silicon در پردازشهای batch size 1 هنوز امکان استفاده بهینه از DSpark رو ندارن و این ویژگی اونجا فعلاً کارایی خاصی نداره...
ارزیابیها نشان میدن که در حالت تفکر یا همان thinking mode، نسخه ۱ بیتی حدود ۹۰ درصد و نسخه ternary نزدیک ۹۵ درصد از کارایی مدل اصلی رو حفظ میکنن... برتری بزرگ Bonsai در حفظ رفتارهای عمیق مثل حل مسائل ریاضی، ساختار زنجیره تفکر و نوشتن کدهای برنامهنویسی در لایههای زیر ۲ بیته... جایی که کوانتیزیشنهای معمولی مثل IQ2_XXS کاملاً شکست میخورن...
دیدن بنچمارکهای جدید مدل ۱ بیتی Bonsai 27B واقعاً آدم رو به آینده پردازش لوکال امیدوار میکنه... نسخه 1-bit این مدل با حجم ناچیز ۳.۹ گیگابایتی توی تستهای فوق سخت ریاضی مثل AIME 2025 و بنچمارک کدنویسی LiveCodeBench پایاپای با GPT-5 Low رقابت کرده و حتی با اختلاف جزئی جلو زده... این یعنی منطق محاسباتی سنگین بالاخره راهش رو به دستگاههای کوچک و جیبی باز کرده...
جالبتر اینکه توی رقابت با مدل معروف GPT-4o، این مدل کمحجم برتری خودش رو توی بنچمارکهای کلیدی مثل MATH-500، ارزیابیهای ایجنتی τ²-Bench و تستهای دستوری IFBench ثابت کرده... داشتن چنین سطحی از هوش بدون نیاز به سرورهای ابری و به صورت کاملاً آفلاین، دست ما رو برای ساخت پروژههای شخصی و ابزارهای کاربردی بازتر میکنه... با اینکه هنوز محدودیتهایی داره، اما یک شروع فوقالعاده برای نسل جدید مدلهای لوکاله...
https://huggingface.co/prism-ml
🛠 Join @LLMEngineers Community
Post #412
1.16K
- 🔥 12
- ❤ 6
- 👍 3