Intel опустила вес тернарных LLM ниже 1,58 бита
Intel предложила BITCOS: формат хранит тернарные веса LLM в двух массивах — карте нулей и знаках остальных значений. На модели с 51,48% нулей расход снизился до 1,485 бита на вес без учета масштабов.
В тестах авторов декодирование в vLLM ускорилось максимум в 1,18 раза на CPU и в 1,27 раза на GPU. Переобучать модель не нужно, но выигрыш зависит от железа: на восьмиядерном Lunar Lake ускорения не получили. Работа пока опубликована только как препринт.
🔗 Читать: https://mltimes.ai/intel-opustila-ves-ternarnyh-llm-nizhe-1-58-bita/
Post #3055
698

- 👍 2