TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #273 1.3K
عملیات Fine-tune با Unsloth الان ۳ تا ۵ برابر سریع‌تر شده. بحث فقط سرعت نیست، مدیریت VRAM به شدت بهینه شده و عملاً با سخت‌افزار ضعیف‌تر می‌تونید مدل‌های سنگین‌تر رو Train کنید.

تکنیک اصلی که اضافه شده Uncontaminated Packing هست. توی حالت استاندارد وقتی Batch Size رو بالا می‌برید، چون طول Sequenceهای دیتاست متفاوته، GPU مجبور میشه کلی Padding (صفر) اضافه کنه تا ماتریس‌ها هم‌اندازه بشن. این یعنی پردازشِ هیچی.
مکانیزم Packing میاد Sequenceهای کوتاه رو هوشمندانه می‌چسبونه کنار هم توی یک Tensor واحد، بدون اینکه Attention Mask بین نمونه‌ها نشت کنه (Leakage). نتیجه؟ دور ریز محاسباتی تقریباً صفر میشه.

کرنل‌های Triton هم بازنویسی شدن. مخصوصاً کرنل RoPE و MLP.
قبلاً توی Contextهای خیلی طولانی (مثلاً 500K) ارورهای عجیب CUDA Out of Bounds می‌گرفتیم. دلیلش این بود که Indexing پیش‌فرض روی Int32 بود. الان Unsloth اومده از Int64 Indexing استفاده کرده که این گلوگاه رو برای Long Context Training باز می‌کنه.
علاوه بر این، عملیات RoPE الان کاملاً In-place انجام میشه و کپی‌های اضافی حافظه حذف شده.

توی بنچمارک‌های واقعی روی مدل‌هایی مثل Qwen3 و Llama 3:
کاهش مصرف VRAM بین ۳۰ تا ۹۰ درصد (بسته به کانفیگ) دیده میشه.
سرعت آموزش بطور متوسط ۳ برابر شده. اگر دیتای شما شامل جملات کوتاه و بلندِ میکس باشه، این سرعت تا ۵ برابر هم میرسه (چون تاثیر Packing بیشتر میشه).
نکته مهم اینه که حتی اگر Packing رو فعال نکنید، حالت پیش‌فرض جدید (Padding-free) خودش حدود ۱.۵ تا ۲ برابر سریع‌تر از نسخه قبلیه.

به نظر من این آپدیت برای کسایی که محدودیت GPU دارن (اکثر ماها) حیاتیه. الان میشه روی یه کارت T4 توی Colab مدل‌های 8B یا حتی 14B رو با سرعت خیلی معقول‌تری Fine-tune کرد. دقت مدل هم طبق بنچمارک‌ها هیچ تغییری نمی‌کنه و Loss Curve دقیقاً منطبق بر حالت استاندارده.

برای استفاده کافیه کتابخونه رو آپدیت کنید و توی SFTConfig آرگومان packing = True رو ست کنید. بک‌اند‌های Flash Attention 3 و xFormers هم ساپورت میشن.

📃 داکیومنت و بنچمارک‌های کامل:
https://docs.unsloth.ai/new/3x-faster-training-packing

🛠 Join @LLMEngineers Community
More from @llmengineers
  1. Oct 11, 2026توی یکی از پروژه‌هام با یه مشکل نسبتاً جدی روبه‌رو شدم: استخراج دقیق متن از PDFهای فارسی ب…
  2. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  3. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  4. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  5. Oct 7, 2026photo post
  6. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →