Сегодня напишу про то, как мы можем оценивать какие части модели влияют на определенное поведение
Из статьи Transformer Circuit Faithfulness Metrics Are Not Robust
Модель можно представить как вычислительный граф.
🟡Вершинами в зависимости от целей можно рассматривать разные сущности, так в языковых моделях обычно фокусируются на attention головах и на многослойных перцептронах (MLP), которые получают на вход информацию из голов. (см картинку)
🟡Ребрами графа буду являться связи между вершинами, т.е, ребро появляется, если одна из вершин передает что-то другой.
Если нам интересно как конкретно одна голова влияет на весь процесс, мы можем подменять ее выход и смотреть, как меняется поведение модели. Однако, в этом случае меняется и поведение всех последующих элементов, так как они теперь получают измененную информацию на вход, и, соотвественно могут совсем по другому ее обработать.
Post #16
645

- 🍌 1