خیلی جالبه یه مدل ۲۷ میلیاردی فقط تقریبا ۶ گیگ فضا نیاز دارد. اخیرا با پروژه 𝗣𝗿𝗶𝘀𝗺𝗠𝗟 آشنا شدم. یه مدلی به نام Ternary Bonsai 2 27B است که بر پایه مدل qwen3.8 27 B است. ولی جالبی قضیه اینه که وزن های مدل از وزنهای سهگانه {۱+، ۰، ۱-} به همراه مقیاسبندی گروهی FP16 استفاده میکند که منجر به ۱٫۷۶ بیت موثر به ازای هر weight میشود. این معماری قبلا هم در معماری مدل BitNet b1.58 2B4T که ماکروسافت ارائه کرده است اجرا شده است. context window این مدل 262K و از ورودی های تصویر هم پشتیبانی می کند.
با ابزار llmfit بررسی کردم که مدل qwen 27B و Q3_K_M حدود ۹۰ درصد از gpu ۵۰۷۰ ti را اشتغال میکنه ولی این مدل با kv cache 32,768 تنها حدود 10.5 گیگ را اشغال کرده است. مدل را با llama.cpp سرو کردم و نرخ تقریبا ۸۰ توکن بر ثانیه داده است. فارسی هم پشتبانی میکنه و در کد زنی هم میتونید ازش استفاده کنید.
هسته اصلی این استارتاپ ایرانی و اساتید دانشگاه های برتر آمریکا هستند.
بخشی از آینده مدل های زبانی به سمت بهرهوری معماری در حرکت است. پیشنهاد میکنم اگر به تست مدلهای لوکال علاقه دارید حتما این مدل را بررسی کنید.
لینک ها:
بلاگ مدل Bonsai 2 27B:
https://prismml.com/news/bonsai-2-27b
مدل BitNet b1.58 2B4T ماکروسافت
https://huggingface.co/microsoft/bitnet-b1.58-2B-4T
@DevTwitter | <Ehsan Rahnama/>
Post #13489
1.85K


- 🔥 6
- ❤ 5
- 🍌 2