TGViewer
Linuxor ? Linuxor ? @linuxor · 31.7K subscribers
Post #5443 6.81K
برای کسایی که با مدل ها زیاد سرو کله می‌زنن، انویدیا یه جعبه ابزار برای بهینه‌سازی مدل‌های AI داره قبل از اینکه مدل رو ببری برای inference، کمک می‌کنه مدل رو کم‌حجم‌تر و کم‌مصرف‌تر و سریع‌تر کنی.

تمرکز اصلیش روی چیزهایی مثل Quantization، Pruning، Sparsity و Distillation هستش. مثلاً می‌تونی یه مدل BF16 رو به FP8 یا NVFP4 تبدیل کنی تا VRAM و هزینه محاسبات کمتر بشه، البته با کنترل افت کیفیت مدل.

نکته جالبش اینه که ModelOpt خودش جای vLLM یا TensorRT-LLM نیست؛ بیشتر نقش مرحله‌ی optimization رو داره. یعنی مدل رو آماده می‌کنی و بعد می‌دی به inference engineهایی مثل vLLM، SGLang یا TensorRT-LLM تا روی GPU اجرا بشه.

اگه با مدل‌های بزرگ و GPU های NVIDIA کار می‌کنی، ModelOpt یه جعبه‌ابزار برای اینه که از همون مدل، نسخه‌ای سبک‌تر و مناسب‌تر برای production بسازی؛ مخصوصاً وقتی بحث FP8/NVFP4، کاهش VRAM و افزایش throughput مطرح باشه:

nvidia.github.io/Model-Optimizer


@Linuxor
More from @linuxor
  1. Sep 28, 2026دکمه‌ی Turbo روی کیس‌های قدیمی یکی از چیزهای جالب کامپیوترهای دهه‌های 1980 و 1990 بود. توی…
  2. Sep 28, 2026آموزش گام به گام اجرای مدل‌های Laya Decision رو به‌صورت لوکال و فقط با 4GB رم روی CPU، مک،…
  3. Sep 28, 2026تقریبا همه بازی های ساخته شده هوش مصنوعی که روی وب کار میکنن از Three.js استفاده میکنن اما…
  4. Sep 28, 2026این ویدیو هم جالب بود روی گوشی S26 مدل تصمیم گیر شبیه Jev به اسم Laya-LiteRT رو ران میکنه…
  5. Sep 28, 2026فروش Gemini Pro و Super Duolingo فقط 480 هزار تومن به مدت ۴۸ ساعت. 🛒 جهت ثبت سفارش: @AccA…
  6. Sep 28, 2026اگر سایت یا اپی دارید که داخلش دارید از چارت های مختلفی استفاده میکنید این دو تا سایت به د…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →