یکی از مباحث مهم، کوچک کردن مدلهای غولپیکره. قبلا یه پست (https://t.me/nlp_stuff/60) دربارهاش گذاشته بودیم. Quantization یکی دیگه از روشهای کوچک کردن مدلهای بزرگه. در این روش بدون آموزش مجدد، مثلا اعداد اعشاری ۳۲ بیتی با یک عدد صحیح ۸ بیتی تخمین زده میشه و با اینکه کارایی مدل یه ذره کم میشه، اما حجم مدل خیلی پایین میاد و کلی در مصرف رم و حافظه صرفهجویی میشه و سرعت بالا میره.
در لینک زیر این روش برای مدلهای کتابخانهی hugging face و با استفاده از کتابخانهی ONNX Runtime پیاده شده و نتایج مقایسه شده:
https://medium.com/microsoftazure/faster-and-smaller-quantized-nlp-with-hugging-face-and-onnx-runtime-ec5525473bb7
#read
#blog
@nlp_stuff
Post #76
1.21K

