Предложенное преобразование строится следующим образом:
📌 Первой идет Адамарова матрица
📌 Затем диагональная S^{-½} и ортогональная U матрицы из SVD разложения
W’ X = U S V^T (W’ - из разложения Холески W’ W’^T = W W^T).📌 И затем сам Холески фактор W’^T.
Полученная конструкция выглядит следующим образом:
T = H S^{-½} U^T W’^T Или WUSH, если прочитать наоборот.
Здесь важно заметить, что преобразование на самом деле имеет блочно-диагональную форму, т.е на выходе имеем d_in / g матриц размера gxg (g - размер группы квантизации).
Далее в статье приводятся теоретические аргументы в пользу оптимальности такого вращения для INT и FP форматов в предположении об использовании round-to-nearest квантизации.
🧪 Эксперименты
Метод валидируют на квантизации Llama-3 и Qwen-3 семейств моделей. Рассматриваются на бенчи из OpenLLM Leaderboard v1, так и Platinum Bench из почищенных задач из разных бенчмарков.
WUSH накидывает 1-3% в сравнении с identity и Адамаровыми вращениями. Разница для MXFP чуть больше.
💡 Выводы
Выглядит как интересная альтернатива приевшимся Адамаровым матрицам. Важный нюанс, правда, в том, что оверхед от таких преобразований неизбежно больше, чем у фиксированных вращений, ибо блочно-диагональная матрица целиком не влезет в кэши и иную эффективную память у GPU.