A highly technical blog tailored for AI engineers.
Chat: @AI_LLMs
Personal blog: mshojaei77.github.io/
Contact me: @realshojaeii
Post #406
1.33K
داشتم با این Colibrì ور میرفتم... ایدهی اینکه یه مدل ۷۰۰ میلیاردی مثل GLM-5.2 رو روی ۲۵ گیگ رم بالا بیاری، در تئوری جذابه ولی در عمل یعنی با NVMe کشتی میگیری. سیستمش دقیقاً مثل یه دیتابیس عمل میکنه؛ لایههای dense رو تو رم نگه میداره، ولی expertهای MoE رو فقط وقتی لازم باشن از SSD میخونه. عملاً یه storage hierarchy ساخته که بین VRAM و RAM و دیسک جابهجا میشه.
کاربرد اصلیش برای وقتیه که سختافزار نداری ولی میخوای خروجی یه مدل frontier رو ببینی. معماری MLA رو با یه ترفند جالب به اسم weight absorption بهینهسازی کرده که باعث میشه حجم KV Cache خیلی کم بشه. اما کوانتیزهکردنش خیلی خشنه؛ row-wise int4 بدون هیچ کالیبراسیون خاصی. یعنی احتمالا دقت مدل نسبت به نسخه اصلی افت محسوسی داره.
سرعت خوندن از دیسک گلوگاه اصلیه. اگه SSD خفن نداشته باشی، زیر ۰.۱ توکن در ثانیه میگیری. نکته عجیبش هم MTP یا همون speculative decoding هست که اینجا ممکنه برعکس عمل کنه؛ چون حدس زدن توکنهای بعدی یعنی باید expertهای بیشتری از دیسک خونده بشه و I/O سیستم میترکه. کدهاش به زبان C و بدون وابستگی نوشته شده، خیلی raw و مستقیم... ولی فعلاً برای کار جدی زوده.
https://github.com/JustVugg/colibri
🛠 Join @LLMEngineers Community
کاربرد اصلیش برای وقتیه که سختافزار نداری ولی میخوای خروجی یه مدل frontier رو ببینی. معماری MLA رو با یه ترفند جالب به اسم weight absorption بهینهسازی کرده که باعث میشه حجم KV Cache خیلی کم بشه. اما کوانتیزهکردنش خیلی خشنه؛ row-wise int4 بدون هیچ کالیبراسیون خاصی. یعنی احتمالا دقت مدل نسبت به نسخه اصلی افت محسوسی داره.
سرعت خوندن از دیسک گلوگاه اصلیه. اگه SSD خفن نداشته باشی، زیر ۰.۱ توکن در ثانیه میگیری. نکته عجیبش هم MTP یا همون speculative decoding هست که اینجا ممکنه برعکس عمل کنه؛ چون حدس زدن توکنهای بعدی یعنی باید expertهای بیشتری از دیسک خونده بشه و I/O سیستم میترکه. کدهاش به زبان C و بدون وابستگی نوشته شده، خیلی raw و مستقیم... ولی فعلاً برای کار جدی زوده.
https://github.com/JustVugg/colibri
🛠 Join @LLMEngineers Community
- 👍 9
- ❤ 1
- 🔥 1





