Энтузиаст сократил объём языковой модели GLM-5.2 с 1 403 ГБ до 980 ГБ, не изменяя её содержимое.
По его словам, метод не использует квантизацию, дообучение и любые другие модификации модели.
Заявлено, что модель остаётся бит в бит идентичной оригиналу, а уменьшение объёма достигается за счёт нового подхода к работе с весами. Вместо предварительного разворачивания полной модели веса сохраняются в сжатом виде непосредственно в VRAM, что позволяет избежать необходимости восстанавливать их перед выполнением вычислений. 🚬
Post #3473
16.7K