Исследователям надо было держать баланс между тем, чтобы
а) тесты были корректным, осмысленными и действительно проверяли ввод, а не просто были легкопроходимым заглушками;
б) в тестах не было регулярных выражений;
в) чтобы весь процесс, как определения признаков, так и вмешательство во время генерации было не очень долгим.
И как раз их метод SAE-based интервенеций лучше всего справился с тем, чтобы выдержать этот баланс (показано с помощью Pareto-dominance). Кроме того, у этого метода достаточно высокая точность — признак действительно активировался только на регулярные выражения. Интересно кстати, что у Gemma всего один признак полностью отвечал за появление регулярных выражений, в то время как у натренированного исслдеователями SAE для LLaMA таких признаков оказалось больше 50.
В качестве заключения, авторы еще раз подчеркивают, что данный метод не является специфичным и может быть применен к любым схожим задачам. Кроме того, у исследователей есть возможность самостоятельно проверять что найденный признак соотносится с нашими ожиданиями (с помощью Neuronpedia, см. картинку), что упрощает весь процесс и отнимает не так много времени на исследования и поиск гипотез, в отличии от других методов для решениях схожих задач.
Такая вот интересная работа, определенно надо пробовать применять SAE и к другим таким техническим задачам.
Ссылка на посте в блоге Tilde Research
Post #34
827

- 👍 6
- 🔥 3