TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #412 1.16K
همیشه دوست داشتم یه مدل به درد بخور رو لوکال بالا بیارم ولی محدودیت VRAM واقعاً روی اعصاب بود (کارت گرافیک RTX 3050 با ۶ گیگابایت حافظه VRAM )
قبلاً حتی فکر کردن به لود کردن Qwen3.6-27B روی چنین سخت‌افزاری شبیه شوخی بود، اما نسخه 1-bit مدل جدید Bonsai 27B که کلاً ۳.۹ گیگابایت فضا می‌گیره رو انداختم توی LM Studio و خیلی راحت روی کارت نشست و حتی مقداری فضا برای کانتکست باقی موند...

بررسی ساختار این مدل نشون میده که چطور به این حجم رسیدن... برخلاف اکثر روش‌های کوانتیزیشن رایج که فقط بخشی از وزن‌ها رو فشرده می‌کنن و بخش‌های حساس مثل embeddings یا attention projections رو دست‌نخورده می‌ذارن، تکنولوژی Bonsai به صورت کاملاً end-to-end تمام لایه‌ها رو فشرده می‌کنه... توی مدل‌های معمولی اگه زیر ۴ بیت بریم مدل کلاً متلاشی می‌شه و رفتارهای منطقی خودش رو از دست میده، اما این پروژه وزن‌ها رو بر پایه یک فریم‌ورک ریاضیاتی دقیق به فرمت‌های فوق فشرده تبدیل کرده... نسخه Ternary این مدل با وزن‌های {-1, 0, +1} و یک اسکیل FP16 به ازای هر ۱۲۸ وزن، کلاً ۱.۷۱ بیت به ازای هر وزن مصرف می‌کنه (حدود ۵.۹ گیگابایت)... نسخه ۱ بیتی هم فقط از وزن‌های {-1, +1} استفاده می‌کنه که حجم نهایی رو به ۱.۱۲۵ بیت یعنی حدود ۳.۹ گیگابایت می‌رسونه... این یعنی عملاً امکان اجرای یک مدل کلاس ۲۷ میلیاردی روی گوشی‌های موبایل با رم محدود هم فراهم شده...

مسئله بعدی که معمولاً اجرای لوکال رو غیرممکن می‌کنه، حجم عظیمی هست که KV cache در کانتکست‌های طولانی اشغال می‌کنه... خوشبختانه معماری پایه Qwen3.6 به صورت hybrid-attention طراحی شده؛ یعنی فقط ۱۶ لایه از ۶۴ لایه اون به صورت full-attention کار می‌کنن و بقیه لایه‌ها ساختار linear-attention دارن که حافظه ثابتی می‌خواد... این باعث می‌شه حجم کش مدل از همان ابتدا ۴ برابر کوچک‌تر از مدل‌های متراکم عادی باشه... علاوه بر این، مدل‌های Bonsai مقاومت عجیبی در برابر کوانتیزیشن ۴ بیتی KV cache دارن... آزمایش‌های forward-KL divergence نشون میده که افت کیفیت ناشی از فشرده‌سازی کش در این مدل بسیار کمتر از مدل‌های عادیه... با فعال کردن کش ۴ بیتی، حافظه مورد نیاز برای کانتکست ۱۰۰ هزار توکنی در نسخه ۱ بیتی به حدود ۶.۸ گیگابایت کاهش پیدا می‌کنه که برای اجرا روی لپ‌تاپ‌های معمولی فوق‌العاده‌ست...

پیاده‌سازی این کار به کرنل‌های کاستوم نیاز داره تا سخت‌افزار بتونه وزن‌های کم‌بیت رو مستقیماً بدون نیاز به expand کردن در حافظه پردازش کنه... توسعه‌دهنده‌ها این مسیرها رو روی MLX برای محصولات اپل و CUDA برای کارت‌های انویدیا آماده کردن... همچنین برای افزایش سرعت تولید توکن، یک لایه درفت اختصاصی به اسم DSpark همراه مدل ارایه شده که به روش speculative-decoding سرعت خروجی رو روی کارت‌های انویدیا تا ۳۷ درصد بیشتر می‌کنه... البته طبق گزارش‌ها، سیستم‌های Apple Silicon در پردازش‌های batch size 1 هنوز امکان استفاده بهینه از DSpark رو ندارن و این ویژگی اونجا فعلاً کارایی خاصی نداره...

ارزیابی‌ها نشان میدن که در حالت تفکر یا همان thinking mode، نسخه ۱ بیتی حدود ۹۰ درصد و نسخه ternary نزدیک ۹۵ درصد از کارایی مدل اصلی رو حفظ می‌کنن... برتری بزرگ Bonsai در حفظ رفتارهای عمیق مثل حل مسائل ریاضی، ساختار زنجیره تفکر و نوشتن کدهای برنامه‌نویسی در لایه‌های زیر ۲ بیته... جایی که کوانتیزیشن‌های معمولی مثل IQ2_XXS کاملاً شکست می‌خورن...

دیدن بنچمارک‌های جدید مدل ۱ بیتی Bonsai 27B واقعاً آدم رو به آینده پردازش لوکال امیدوار می‌کنه... نسخه 1-bit این مدل با حجم ناچیز ۳.۹ گیگابایتی توی تست‌های فوق سخت ریاضی مثل AIME 2025 و بنچمارک کدنویسی LiveCodeBench پایاپای با GPT-5 Low رقابت کرده و حتی با اختلاف جزئی جلو زده... این یعنی منطق محاسباتی سنگین بالاخره راهش رو به دستگاه‌های کوچک و جیبی باز کرده...

جالب‌تر اینکه توی رقابت با مدل معروف GPT-4o، این مدل کم‌حجم برتری خودش رو توی بنچمارک‌های کلیدی مثل MATH-500، ارزیابی‌های ایجنتی τ²-Bench و تست‌های دستوری IFBench ثابت کرده... داشتن چنین سطحی از هوش بدون نیاز به سرورهای ابری و به صورت کاملاً آفلاین، دست ما رو برای ساخت پروژه‌های شخصی و ابزارهای کاربردی بازتر می‌کنه... با اینکه هنوز محدودیت‌هایی داره، اما یک شروع فوق‌العاده برای نسل جدید مدل‌های لوکاله...


https://huggingface.co/prism-ml

🛠 Join @LLMEngineers Community
  • 🔥 12
  • ❤ 6
  • 👍 3
More from @llmengineers
  1. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  2. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  3. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  4. Oct 7, 2026photo post
  5. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
  6. Sep 30, 2026جمنای ۴ معرفی شد !
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →