TGViewer
Техножрица 👩‍💻👩‍🏫👩‍🔧 Техножрица 👩‍💻👩‍🏫👩‍🔧 @tech_priestess · 14.9K subscribers
Post #933 2.77K
Расскажу сегодня про статью "INTRINSIC DIMENSIONALITY EXPLAINS THE EFFECTIVENESS OF LANGUAGE MODEL FINE-TUNING" 2020-2021 года ( https://aclanthology.org/2021.acl-long.568/ ). #объяснения_статей

Честно говоря, я не стала вникать во все технические детали (так что не стесняйтесь поправлять в комментариях, если где ошибусь), но могу поделиться главными результатами и выводами, а также своими собственными мыслями по этому поводу.

Я уже упоминала данную статью в посте https://t.me/tech_priestess/781 , как одну из статей, которыми вдохновились авторы LoRA. И немудрено: ведь в данной статье авторы как раз показывают, что для того, чтобы достаточно хорошо решать задачи из GLUE, достаточно дотюнить лишь малое подпространство в пространстве всех параметров модели. А для того, чтобы спроецировать параметры модели в это самое подпространство меньшей размерности, авторы используют алгоритм Fastfood transform (который, на наш взгляд из 2к23, чем-то напоминает LoRA, но содержит умножение большего количества различных матриц и, видимо, из-за этого не такой быстрый и эффективный). Двумя различными способами они измеряют внутренние размерности подпространства параметров, которые изменяются в процессе применения данного алгоритма, а затем вводят величину, которую называют d_90.
Сейчас надо вчитаться внимательно: эта величина равна внутренней размерности того подпространства параметров, которое достаточно изменить с помощью Fastfood, чтобы получить на данной задаче точность 90% от максимальной. А максимальной считается точность, достигнутая полным обучением всех параметров модели (без Fastfood).
Например, определим, что такое d_90(MRPC) для модели RoBERTa. Для этого я напомню, что MRPC - это задача бинарной классификации, в которой модели дают на вход два предложения, и она должна определить, является ли одно из них перефразировкой другого. Далее допустим, мы сделали полный тюнинг RoBERTa обычным оптимизатором и получили 89% точности на этой задаче. Тогда d_90(MRPC) - это внутренняя размерность того подпространства параметров, которое достаточно дотюнить с помощью Fastfood transform, чтобы получить 89*0.9 == 80.1% точности на этой же задаче.
Так вот, авторы изучили зависимость d_90 от размера модели, и оказалось, что эта величина для моделей типа BERT и RoBERTa large на задачах MRPC и QQP имеет совсем небольшой порядок - в районе от нескольких сотен до нескольких тысяч (напомню, что сами модели имеют сотни миллионов параметров), а еще что d_90 уменьшается в процессе предобучения. Но настоящий шок будет в следующем посте. Так что прежде чем читать дальше,

УБЕРИТЕ ДЕТЕЙ ОТ ЭКРАНОВ! 😱
ACL Anthology Intrinsic Dimensionality Explains the Effectiveness of Language Model Fine-Tuning Armen Aghajanyan, Sonal Gupta, Luke Zettlemoyer. Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers). 2021.
  • 👍 6
  • 🔥 3
More from @tech_priestess
  1. Sep 19, 2026Естественно, после резкой отмены нейролептика сразу же вернулись все прелести смешанного э…
  2. Sep 19, 2026В комментариях к посту про сон, тем временем, творился сущий кошмар: одни комментаторы дав…
  3. Sep 19, 2026Что значит "некоторые"? 🤨
  4. Sep 18, 2026Ночь с пятницы на субботу - идеальное время для следующего релиза моей текстовой нейрослоп…
  5. Sep 17, 2026А ведь все время пока мы хихикали, он реально думал над этим длинным промптом и в конце че…
  6. Sep 17, 2026Сделает? 🥺
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →