Что: Matryoshka Attribution помогает найти веса сети, отвечающие за конкретное поведение
Ссылка: https://arxiv.org/pdf/2609.25518
Почему интересно: Исследователи из Стэнфорда опубликовали поход к решению весьма насущной задачи интерпретируемости - атрибуции. Как правило, разработчикам (да и пользователям) интересно знать, какие именно головы внимания, нейроны или фичи отвечают за конкретное поведение модели. Существующие подходы делятся на 3 блока, и у каждого свои ограничения: каузальные дают точный ответ, но требуют колоссальных вычислений для точного ответа ввиду экспоненциальной сложности перебора; градиентные методы часто не находят реальные причинно-следственные связи; маскированное обучение требует тонкой ручной настройки гиперпараметров, страдает от нестабильности и плохо работает с разными уровнями разреженности данных.
В своей работе авторы предложили метод Matryoshka Attribution (MAttr), попытавшись объединить все 3 парадигмы и переформулировав поиск важных для интерпретации компонентов как задачу оптимизации. Предлагается обучать маску, которая находит вложенные подмножества внутренних компонентов, минимизирующих ошибку на целевой задаче. Главная фишка метода в использовании особого дифференцируемого сигмоидного top-k оператора. Модель учится ранжировать компоненты по важности одновременно для всех уровней сжатия, напоминая некий аналог матрёшки.
MAttr с кратным отрывом занял первое место в официальном лидерборде Mechanistic Interpretability Benchmark (справедливости ради, синтетическом). Но самое интересное в статье в практическом применении подхода для выборочного отката весов с целью направленного изменения поведения сети. В частности, авторы показали, как с помощью RL локализовать изменения весов, возникающие при файнтюнинге.
В качестве демонстрации они взяли Llama 3.1 8B Instruct и поставили задачу убрать встроенные отказы модели без потери адекватности ответов. С помощью MAttr найдено, что откат всего 1-2% весов к состоянию базовой модели полностью вырезает цензуру, при этом модель сохраняет свои способности к математике и следованию инструкциям. Такой результат открывает большой простор не только для джейлбрейка моделей, но и в широком смысле для фокусной работы со специфичным поведением на широких классах задач.
Конечно, работа не претендует на полное раскрытие поведения моделей, это всё-таки white-box интерпретируемость. Кроме того, метод требует доступа к весам и внутренним активациям, что делает его бесполезным для закрытых API (так что вырезать цензуру из Claude или GPT не получится). Но с практической точки зрения для доменов с onprem решениями, эти ограничения несущественны.
Что по-прежнему вызывает вопросы, так это надёжность подобных операций. Поскольку нейросети являются сильносвязными структурами, возврат отдельных групп весов к базовому состоянию может вызвать непредсказуемые побочные эффекты на длинной дистанции или в специфичных доменных задачах, которые не ловятся стандартными бенчмарками.
Ещё одним практическим соображением, которое надо иметь в виду, является стоимость использования RL для атрибуции параметров (собственно, все LLM в статье содержат не больше 8 млрд параметров). Обучение масок потребует множества прямых и обратных проходов, что делает метод мало применимым для моделей размером в сотни миллиардов параметров без доступа к очень мощному железу.
Любопытен и сам по себе результат с 1% весов у LLama. С одной стороны, это показывает, насколько точечными могут быть изменения поведения при файнтюнинге. С другой стороны, это же означает, что отказ модели от нежелательных запросов - весьма хрупкая надстройка.
#eng #интерпретируемость #llm #ии #безопасность #исследование
Post #615
54