TGViewer
Пятничный ИИ Пятничный ИИ @va_friday_ai · 225 subscribers
Post #615 54
Что: Matryoshka Attribution помогает найти веса сети, отвечающие за конкретное поведение
Ссылка: https://arxiv.org/pdf/2609.25518
Почему интересно: Исследователи из Стэнфорда опубликовали поход к решению весьма насущной задачи интерпретируемости - атрибуции. Как правило, разработчикам (да и пользователям) интересно знать, какие именно головы внимания, нейроны или фичи отвечают за конкретное поведение модели. Существующие подходы делятся на 3 блока, и у каждого свои ограничения: каузальные дают точный ответ, но требуют колоссальных вычислений для точного ответа ввиду экспоненциальной сложности перебора; градиентные методы часто не находят реальные причинно-следственные связи; маскированное обучение требует тонкой ручной настройки гиперпараметров, страдает от нестабильности и плохо работает с разными уровнями разреженности данных.
В своей работе авторы предложили метод Matryoshka Attribution (MAttr), попытавшись объединить все 3 парадигмы и переформулировав поиск важных для интерпретации компонентов как задачу оптимизации. Предлагается обучать маску, которая находит вложенные подмножества внутренних компонентов, минимизирующих ошибку на целевой задаче. Главная фишка метода в использовании особого дифференцируемого сигмоидного top-k оператора. Модель учится ранжировать компоненты по важности одновременно для всех уровней сжатия, напоминая некий аналог матрёшки.
MAttr с кратным отрывом занял первое место в официальном лидерборде Mechanistic Interpretability Benchmark (справедливости ради, синтетическом). Но самое интересное в статье в практическом применении подхода для выборочного отката весов с целью направленного изменения поведения сети. В частности, авторы показали, как с помощью RL локализовать изменения весов, возникающие при файнтюнинге.
В качестве демонстрации они взяли Llama 3.1 8B Instruct и поставили задачу убрать встроенные отказы модели без потери адекватности ответов. С помощью MAttr найдено, что откат всего 1-2% весов к состоянию базовой модели полностью вырезает цензуру, при этом модель сохраняет свои способности к математике и следованию инструкциям. Такой результат открывает большой простор не только для джейлбрейка моделей, но и в широком смысле для фокусной работы со специфичным поведением на широких классах задач.
Конечно, работа не претендует на полное раскрытие поведения моделей, это всё-таки white-box интерпретируемость. Кроме того, метод требует доступа к весам и внутренним активациям, что делает его бесполезным для закрытых API (так что вырезать цензуру из Claude или GPT не получится). Но с практической точки зрения для доменов с onprem решениями, эти ограничения несущественны.
Что по-прежнему вызывает вопросы, так это надёжность подобных операций. Поскольку нейросети являются сильносвязными структурами, возврат отдельных групп весов к базовому состоянию может вызвать непредсказуемые побочные эффекты на длинной дистанции или в специфичных доменных задачах, которые не ловятся стандартными бенчмарками.
Ещё одним практическим соображением, которое надо иметь в виду, является стоимость использования RL для атрибуции параметров (собственно, все LLM в статье содержат не больше 8 млрд параметров). Обучение масок потребует множества прямых и обратных проходов, что делает метод мало применимым для моделей размером в сотни миллиардов параметров без доступа к очень мощному железу.
Любопытен и сам по себе результат с 1% весов у LLama. С одной стороны, это показывает, насколько точечными могут быть изменения поведения при файнтюнинге. С другой стороны, это же означает, что отказ модели от нежелательных запросов - весьма хрупкая надстройка.

#eng #интерпретируемость #llm #ии #безопасность #исследование
  • 👍 1
More from @va_friday_ai
  1. Oct 5, 2026Что: NVIDIA Open Agent Safety Platform позволит ограничивать поведение агентов на уровне ж…
  2. Oct 1, 2026Что: Осенний отчёт a16z о состоянии рынков - ИИ-пузырь, триллионные капитальные затраты и…
  3. Sep 30, 2026Что: В MIT задумались о роли образования в эпоху, когда ИИ способен выполнить почти любое…
  4. Sep 28, 2026Что: Осенний open source дамп: суверенная MoE-модель от Яндекса, рассуждающий гигант от Xi…
  5. Sep 26, 2026Что: Предложен подход по интеграции обвязки агента прямо в веса модели Ссылка: https://arx…
  6. Sep 25, 2026Что: DeepMind Institute опубликовал сразу 3 эссе о роевом интеллекте, AGI и глобальной пол…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →