گوگل نسخههای جدید Gemma 4 را با تکنیک Quantization-Aware Training (QAT) منتشر کرده؛ رویکردی که بهجای کوانتایز کردن مدل بعد از آموزش (PTQ)، از همان فرآیند آموزش، محدودیتهای دقت پایین را شبیهسازی میکند. نتیجه این کار، مدلهایی است که با حافظه بسیار کمتر اجرا میشوند اما بخش بزرگی از کیفیت نسخه اصلی را حفظ میکنند. به گفته گوگل، نسخه موبایلی Gemma 4 E2B حتی میتواند با کمتر از ۱ گیگابایت حافظه اجرا شود و برای لپتاپها، موبایلها و Edge Deviceها گزینه بسیار جذابتری باشد.
از طرف دیگر، Unsloth نیز پشتیبانی کامل از این مدلها را اضافه کرده و نشان داده که اگر تبدیل QAT به فرمتهای اجرایی مانند GGUF بهدرستی انجام شود، میتوان افت دقت را به حداقل رساند و در عین حال از مزایای اجرای 4-bit بهره برد. این یعنی اجرای مدلهای بزرگتر روی GPUهای مصرفی و حتی سختافزارهای محدود، بدون قربانی کردن محسوس کیفیت پاسخها. برای توسعهدهندگانی که به اجرای محلی (Local LLM)، Agentها یا اپلیکیشنهای Edge علاقه دارند، Gemma 4 QAT یکی از مهمترین انتشارهای اخیر محسوب میشود.
📚 برای مطالعه بیشتر:
🔹 https://blog.google/innovation-and-ai/technology/developers-tools/quantization-aware-training-gemma-4/
🔹 https://unsloth.ai/docs/models/gemma-4/qat
🌀 @cvision 🌀
Post #4312
4.85K
Tensorflow(@CVision) 🚀 مدل Gemma 4 QAT؛ وقتی کوانتایز شدن دیگر به معنی افت کیفیت نیست ! 🚀
- 🔥 16
- 👍 8
- ❤ 3