یه نفر یک ابزار متنباز ساخته به اسم AirLLM که باهاش میتونی یه مدل 2.8 تریلیون پارامتری رو با یه GPU فقط 4GB VRAMروی لپ تاپت اجرا کنی! از روشی به اسم Layer-wise Inference استفاده میکنه؛ یعنی بهجای اینکه کل مدل رو یکجا داخل VRAM بریزه، فقط همون لایهای که همون لحظه لازمه رو بارگذاری میکنه.
نه Quantization نه Distillation نه Pruning
نمونهها:
مدل DeepSeek-V3 (671B) روی 12GB
مدل Llama 3.1 405B روی 8GB
مدل Kimi K3 (2.8T) با کمتر از 4GB
و با تقریباً همه مدلهای متنباز هم کار میکنه.
جالبتر اینکه بزرگترین مدل، کمترین VRAM رو لازم داره. دلیلش اینه که Kimi K3 یه مدل Sparse MoE هست و برای هر توکن فقط Expertهای موردنیازش رو اجرا میکنه، نه کل لایه. یعنی یه مدل 2.8 تریلیون پارامتری میتونه با VRAM کمتر از بعضی مدلهای 70B اجرا بشه. البته این به معنی سریعتر بودن نیست؛ فقط یعنی محدودیت حافظه دیگه اون مانع نیست.
github.com/lyogavin/airllm
@Linuxor
Post #4674
11.7K
