Разбираю сейчас различные статьи с анализом размерности внутренних представлений трансформеров и вижу, что целый ряд работ проводит такой анализ в контексте файнтюнинга, показывая, что для успешного файнтюнинга достаточно вносить изменение лишь в небольшом подпространстве параметров (например, вот одна из наиболее свежих на данную тему, содержащая множество ссылок на другие работы: https://aclanthology.org/2023.acl-long.95/ ).
Посмотрела я на это и подумала: не подобными ли аналитическими статьями вдохновились и создатели крайне популярного сейчас подхода LORA: LOW-RANK ADAPTATION OF LARGE LANGUAGE MODELS ( https://openreview.net/forum?id=nZeVKeeFYf9 )?
И в самом деле, заглянув в статью про LoRA, я обнаружила, что авторов привело к их замечательному изобретению в том числе чтение статей на данную тему, таких, как: 1) Measuring the Intrinsic Dimension of Objective Landscapes, 2018 ( https://openreview.net/pdf?id=ryup8-WCW ); 2) Intrinsic Dimensionality Explains the Effectiveness of Language Model Fine-Tuning ( https://aclanthology.org/2021.acl-long.568/ ) - см. Рис. 1 (интересно, что первая статья выглядит процентов на 90 как аналитическая-описательная, да и вторая тоже).
Вот так вот статьи с тщательным анализом внутренних представлений и процесса обучения моделей могут привести к большому прорыву и в чисто практических вещах, после того, как их прочитают и намотают на ус умные люди. ✍
#объяснения_статей
Post #781
2.19K

- 🔥 24
- ❤ 6
- 👍 6
- 🤮 2
- ✍ 1