Расскажу сегодня про статью "INTRINSIC DIMENSIONALITY EXPLAINS THE EFFECTIVENESS OF LANGUAGE MODEL FINE-TUNING" 2020-2021 года ( https://aclanthology.org/2021.acl-long.568/ ). #объяснения_статей
Честно говоря, я не стала вникать во все технические детали (так что не стесняйтесь поправлять в комментариях, если где ошибусь), но могу поделиться главными результатами и выводами, а также своими собственными мыслями по этому поводу.
Я уже упоминала данную статью в посте https://t.me/tech_priestess/781 , как одну из статей, которыми вдохновились авторы LoRA. И немудрено: ведь в данной статье авторы как раз показывают, что для того, чтобы достаточно хорошо решать задачи из GLUE, достаточно дотюнить лишь малое подпространство в пространстве всех параметров модели. А для того, чтобы спроецировать параметры модели в это самое подпространство меньшей размерности, авторы используют алгоритм Fastfood transform (который, на наш взгляд из 2к23, чем-то напоминает LoRA, но содержит умножение большего количества различных матриц и, видимо, из-за этого не такой быстрый и эффективный). Двумя различными способами они измеряют внутренние размерности подпространства параметров, которые изменяются в процессе применения данного алгоритма, а затем вводят величину, которую называют d_90.
Сейчас надо вчитаться внимательно: эта величина равна внутренней размерности того подпространства параметров, которое достаточно изменить с помощью Fastfood, чтобы получить на данной задаче точность 90% от максимальной. А максимальной считается точность, достигнутая полным обучением всех параметров модели (без Fastfood).
Например, определим, что такое d_90(MRPC) для модели RoBERTa. Для этого я напомню, что MRPC - это задача бинарной классификации, в которой модели дают на вход два предложения, и она должна определить, является ли одно из них перефразировкой другого. Далее допустим, мы сделали полный тюнинг RoBERTa обычным оптимизатором и получили 89% точности на этой задаче. Тогда d_90(MRPC) - это внутренняя размерность того подпространства параметров, которое достаточно дотюнить с помощью Fastfood transform, чтобы получить 89*0.9 == 80.1% точности на этой же задаче.
Так вот, авторы изучили зависимость d_90 от размера модели, и оказалось, что эта величина для моделей типа BERT и RoBERTa large на задачах MRPC и QQP имеет совсем небольшой порядок - в районе от нескольких сотен до нескольких тысяч (напомню, что сами модели имеют сотни миллионов параметров), а еще что d_90 уменьшается в процессе предобучения. Но настоящий шок будет в следующем посте. Так что прежде чем читать дальше,
УБЕРИТЕ ДЕТЕЙ ОТ ЭКРАНОВ! 😱
Post #933
2.77K