TGViewer
Linuxor ? Linuxor ? @linuxor · 32.1K subscribers
Post #4674 11.7K
یه نفر یک ابزار متن‌باز ساخته به اسم AirLLM که باهاش می‌تونی یه مدل 2.8 تریلیون پارامتری رو با یه GPU فقط 4GB VRAMروی لپ تاپت اجرا کنی! از روشی به اسم Layer-wise Inference استفاده می‌کنه؛ یعنی به‌جای اینکه کل مدل رو یکجا داخل VRAM بریزه، فقط همون لایه‌ای که همون لحظه لازمه رو بارگذاری می‌کنه.

نه Quantization نه Distillation نه Pruning
نمونه‌ها:
مدل DeepSeek-V3 (671B) روی 12GB
مدل Llama 3.1 405B روی 8GB
مدل Kimi K3 (2.8T) با کمتر از 4GB
و با تقریباً همه مدل‌های متن‌باز هم کار می‌کنه.

جالب‌تر اینکه بزرگ‌ترین مدل، کمترین VRAM رو لازم داره. دلیلش اینه که Kimi K3 یه مدل Sparse MoE هست و برای هر توکن فقط Expertهای موردنیازش رو اجرا می‌کنه، نه کل لایه. یعنی یه مدل 2.8 تریلیون پارامتری می‌تونه با VRAM کمتر از بعضی مدل‌های 70B اجرا بشه. البته این به معنی سریع‌تر بودن نیست؛ فقط یعنی محدودیت حافظه دیگه اون مانع نیست.

github.com/lyogavin/airllm

@Linuxor
More from @linuxor
  1. Oct 6, 2026این MCP واقعاً خفنه. می‌تونی ازش بخوای توضیحات درسیت رو به‌صورت زنده برات نقاشی کنه، با صد…
  2. Oct 6, 2026وقتی سرور های شرکت هک شده، تیم DevOps همون لحظه: @Linuxor
  3. Oct 6, 2026این ابزارم جالبه باهاش می‌تونید مدل های هوش مصنوعی رو از نظر امنیتی به چالش بکشید یه بخش ه…
  4. Oct 6, 2026این بار ساده‌تر با لینگانو ادامه بده! 📕 📍دسترسی نامحدود به دوره‌ها 📍پنل اختصاصی در سایت…
  5. Oct 6, 2026معیار توکن بر ثانیه معیار خوبی برای مقایسه مدل ها نیست چون Opus 5.5 مقدار توکن برثانیه کمت…
  6. Oct 6, 2026@Linuxor
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →