если хотите почувствовать фомо - авторы из корнелла за год смогли сделать 3 метода квантизации, каждый из которых улучшает предыдущий с математикой и эвристиками (и потому сильно так прибавляют здорового соревновательного аспекта авторам AQLM)
сейчас расскажем про второй - QuIP# (который по таймлайну и перформансу между QuIP и QTIP)
1. КуИП#, как и первый КуИП (который кстати теоретически оптимален для методов адаптивного раундинга), основываются на том факте, что веса в ллмках жестко дисбалансны по распределению и есть выбросы (которые оч сильно влияют на аутпуты) → плохо квантуется моделька. но по
в первой работе они получали эти матрицы через кронекер матрицы, а в # версии через адамаровы (для которых даже отдельный сайт есть) - и быстрее вычислять, и качество не снижает. это называется incoherence pre- and post-processing
2. еще и накидывает в метод с решеткой векторную квантизацию (VQ), а не скалярную, чтобы квантовать веса не в пределах гиперкуба (когда идет округление к целому числу соответствующей битности), а в пределах шара. да и VQ не самый то и обычный гауссовский (к means), а по решетке E8 с оптимальным упаковыванием в группы по 8 весов. это может казаться контринтуитивно, тк квантовать весы распределенные по шару легче при помощи гауссиан по идее, но эмпирически это не так. приводят интересный инсайт, что выделение инфы на краю распределения (что и позволяет делать решетка, но не метод к средних), даже после incoherence processing, намного полезнее
3. завершают это все вишенкой на торте в виде доп файнтюна (который оценивается примерно 50 гпу-часами) который подсмотрели у AQLM: неквантованную модель тюнят на уровне трансформер блоков, а дальше уже минимизируют разницу между исходной моделью в фп16 и квантованной версией
экспы поставлены как обычно на перплексию. по сравнению с предыдущим методом еще написано многое на куда кернелах (которые могут быть оптимизированы еще больше, по заверениям авторов), по скейлу моделек еще все супер вкусно + инферится хорошо. по битностям на 2 3 4 вообще крышу сносит, но достигает парето-оптимальности при 3 битах, в то время как у AQLM это 2.5 бита
make RTX and colab great again, как говорится
но это еще все без PV-tuning & QTIP, про которые мы тоже скоро напишем
👀LINK






