🔬 Метод
Обыкновенно в статьях про квантизацию, да и сжатие в принципе, стремятся не потерять качество на каком-то наборе задач. Однако, может представлять интерес более сильное требование - чтобы распределение сжатой модели не отличалось от исходной модели в пределах шума сэмплирования.
Отсюда определяем 2 возможные цели сжатия:
🚀 Task-lossless сжатие. Качество не просаживается в пределах стандартного отклонения.
🚀 Distribution-lossless. Распределение сжатой модели неотличимо от исходной. Очевидным решением было бы использовать KL-дивергенцию в качестве меры, но абсолютная ее величина не репрезентативна, и вероятности токенов могут заметно шуметь. Вместо этого предлагают EAR (Expected Acceptance Rate), вероятность того, что предсказанный следующий токен для обеих моделей будет один и тот же.
Чтобы добиться distribution-lossless, оказывается важным использовать ассиметричную квантизацию с вычитанием среднего. Даже небольшой перекос распределения сильно увеличивает ошибку и симметричная квантизация требует на целый бит больше, чтобы добиться той же самой ошибки.
Сеть, минимизирующую ошибку, получают следующим образом:
🔅 Квантуют веса в разные точности базовым алгоритмом (GPTQ).
🔅 Затем определяют важность каждого слоя через Shapley оценку
🔅 На основе важностей подбирают оптимальную конфигурацию
🧪 Эксперименты
Исследование проводят на моделях Qwen-3, Qwen-3.5, Llama-3.3-70B-Instruct.
Task-lossless порог для моделей разнится от 3.3 бит для Qwen-3.5-27B до 4.7 бит для Qwen-3-8B. 4-битная однородная квантизация оказывается lossless для всех кроме Qwen-3-8B.
Порог distribution-lossless выше - от 4.98 бит для Qwen-3-32B до 6.55 бит у Llama-3.3-70B-Instruct.
На ризонинге DL квантизация не меняет длину цепочек, а TL и однородная 4-х битная увеличивает число токенов ризонинга на 2-3% (статзначима ли разница?).
С Humming кернелами от Inclusion AI авторы добиваются нетривиальных ускорений (1.6-2.8) раз для distribution-lossless квантизации.
💡 Выводы
Разбиение на task-lossless и distribution-lossless квантизацию выглядит полезным с точки зрения практиков. Вторая должна давать некоторые более сильные гарантии на качество. Однако, возникает вопрос насколько оценка на калибровочной выборке обобщается на все реальные ситуации.
Post #708
1.85K
- 🔥 6