Normalized Architectures are Natively 4-Bit
📄 [Статья]
💻 [Код]
Наличие выбросов в весах и активациях является характерной сложностью при квантизации LLM. Отсюда возникает вопрос: а можно ли избавиться от них на уровне самой архитектуры, и как это взаимодействует с квантизацией?
Пару лет назад вышла статья nGPT, где веса и активации лежат на гиперсфере, и предложенная модификация позволила добиться более быстрой сходимости.
Но как это взаимодействует с квантизацией, и в частности с обучением в низкой точности? В рассматриваемой работе авторы провели теоретический и эмпирический анализ, показывающий, что можно стабильно обучать модели в NVFP4 без необходимости применения специальных техник, как в Quartet II.
Post #756
1.43K

- 👍 4