مدل GLM-5 با معماری MoE و وزنهای باز منتشر شد و نشون داد که جنگ در سال ۲۰۲۶ دیگه روی صرفاً تعداد پارامتر نیست، بلکه روی بهینهسازی سیستم و زیرساخت پسآموزشه. این مدل با ۷۴۴ میلیارد پارامتر کل عرضه شده که موقع استنتاج فقط ۴۰ میلیارد پارامتر فعال داره. حجم دادههای پیشآموزش هم به ۲۸.۵ تریلیون توکن رسیده که نشوندهنده کیفیت و چگالی بالای اطلاعات توی وزنهاست.
معماری Sparse Attention که از DeepSeek قرض گرفته شده، مستقیماً هزینههای عملیاتی رو هدف قرار میده. استفاده از این تکنیک باعث میشه مدیریت Context پنجرههای طولانی بدون ترکیدن VRAM ممکن بشه. واقعیت اینه که داشتن مدل بزرگ بدون Sparse Attention توی محیط Production عملاً یعنی خودکشی مالی، و GLM-5 این رو خوب فهمیده.
زیرساخت Slime که همراه این مدل معرفی شده، به نظر من نقطه عطف اصلی این انتشار برای مهندسهای هوش مصنوعیه. این یه فریمورک RL ناهمگام (Asynchronous) هست که برای مقیاسپذیری الگوریتمهای پسآموزش طراحی شده. ترکیب Megatron برای آموزش سنگین و SGLang برای استنتاج سریع، نشون میده که تیم توسعهدهنده دنبال حل مشکل Train-Inference Mismatch بوده. پشتیبانی کامل از FP8 و FSDP توی Slime یعنی میتونید پروسه RL رو با کمترین هدررفت منابع انجام بدید.
توزیع وزنها در Hugging Face به همراه آرتیفکتهای ارزیابی و راهنمای سرو کردن (Serving Guidance)، استاندارد جدیدی رو برای پروژههای Open-weight تعریف کرده. این که فایلها چند روز قبل از اعلام رسمی آپلود شدن و همزمان مستندات فنی دقیق ارائه شده، نشون میده با یه محصول آماده برای استقرار (Production-ready) طرف هستیم، نه فقط یه مقاله علمی برای نمایش.
به نظر من، ارزش واقعی GLM-5 توی بنچمارکهاش نیست، بلکه توی "قابلیت دیپلوی شدن" و ابزارهای همراهشه. وقتی یه مدل ۷۴۴ میلیاردی رو با مکانیزمهای Sparse طوری بهینه میکنن که با منابع معقول قابل اجرا باشه، یعنی داریم به سمتی میریم که کارایی سیستم (System Efficiency) از تئوریهای معماری پیشی گرفته. اگه دنبال پیادهسازی RLhf یا پروژههای مبتنی بر استدلال (Reasoning) هستید، بررسی Slime واجبتر از خود مدله.
📃 مخزن مدل در هاگینگ فیس:
https://huggingface.co/zai-org/GLM-5
📃 زیرساخت آموزشی Slime در گیتهاب:
https://github.com/THUDM/slime
🛠 Join @LLMEngineers Community
Post #297
1.45K
- 🔥 8