امروز یه پست توی توییتر یکی از مهندسای Baseten خوندم درباره اینکه چطوری سریعترین API رو برای GLM-5.2 ساختن. اعداد Baseten و تکنیکهایی که پیاده کردن واقعاً جای بررسی داره.
کوانتیزاسیون NVFP4 روی گرافیکهای Blackwell کلید اصلیشون بوده. با NVIDIA ModelOpt اومدن مدل رو از FP8 آوردن روی ۴ بیت. نکته فنیش این dual scale factor هاست که اجازه میده dynamic range حفظ بشه. من خودم همیشه توی پروژهها نگران افت کیفیت مدل توی کارهای agentic بودم، اما تستهای اینا روی بنچمارک BFCL نشون میده دقت تقریباً ثابت مونده... یعنی عملاً VRAM کمتر مصرف میشه و سرعت میره بالا بدون اینکه مدل خنگ بشه.
تفکیک فازهای Prefill و Decode یا همون PD Disaggregation بیشترین تاثیر رو توی TPS داشته. توزیع بار و نیازهای سختافزاری بین این دو تا فاز کاملاً متفاوته؛ اولی compute-bound هست و دومی memory-bound. وقتی اینا رو روی انجینهای جداگونه با کانفیگهای متفاوت اجرا کردن، ۲ برابر پرفورمنس بهتر گرفتن. به نظرم ما هم تو زیرساختهای سنگین باید به این سمت بریم، چون توی contextهای بالا، تداخل این دو تا فاز latency رو داغون میکنه.
سیستم KV-aware routing با استفاده از ابزارهای NVIDIA Dynamo هم برای کم کردن TTFT عالی عمل کرده. وقتی مدل ۱ میلیون توکن context window داره، کش کردن پرفیکسها و فرستادن هوشمند درخواست به رپلیکایی که قبلاً اون دیتا رو پردازش کرده، واجبه. مخصوصاً برای agentهایی که هیستوری طولانی دارن و مدام دارن روی یه کانتکست مشترک کار میکنن.
استفاده از Multi-Token Prediction برای speculation هم تیر آخر بوده. تولید چند توکن در هر forward pass که با لایههای MTP خودِ GLM بهینهتر شده و نرخ تایید توکنهای درفت رو بالا برده. به نظرم معماری GLM-5.2 و این ستاپ اینفرنس نشون میده که دیگه دوران استکهای ساده اینفرنس تموم شده. اگه میخوایم توی اسکیل بالا و هزینه پایین کار کنیم، باید سراغ disaggregated inference و کوانتیزاسیونهای نیتیوِ Blackwell بریم.
🛠 Join @LLMEngineers Community
Post #358
1.42K
- ❤ 10