“Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines”
В статье утверждается, что sparse autoencoders, возможно, не такие уж плохие инструменты для steering, как считалось раньше. Значительная часть прошлых неудач могла быть связана не с самими автоэнкодерами, а с тем, что исследователи выбирали и называли неправильные признаки.
Проблема в том, что ранние работы выставляли sparse autoencoders слабыми: их features размечали так, что названия могли не совпадать с тем, что эти признаки реально вызывают внутри модели.
Sparse autoencoder - это небольшая вспомогательная модель, которая раскладывает скрытую активность LLM на множество возможных «признаков»: тему, стиль, концепт или другое внутреннее направление.
То есть sparse autoencoder может найти направление внутри модели, но неназванное направление ещё не становится удобной ручкой управления.
Авторы заменяют размытые или унаследованные названия supervised-пайплайном: они проверяют, действительно ли активность конкретного feature стабильно совпадает с реальной меткой в данных.
Механизм примерно такой: если feature срабатывает на тему «алкоголь», а искусственное усиление этого feature заставляет модель чаще говорить об алкоголе, то метка перестаёт быть просто описательной. У неё появляется причинный смысл.
Ещё один важный вывод: экстремальная разреженность может быть не обязательна. Feature не обязан быть сверхредким, чтобы быть полезным для steering.
Важно и сравнение с prompting. И prompting, и feature steering пытаются подтолкнуть LLM к нужному поведению.
Но prompting обычно сильнее, потому что модель специально обучали следовать промптам. Feature steering работает грубее: мы как будто напрямую нажимаем на внутренний механизм модели и надеемся, что остальная система не развалится.
Prompting говорит модели во входе: «напиши про алкоголь». Feature steering делает иначе: он усиливает внутренний «alcohol-related» feature и проверяет, сдвинется ли ответ в эту сторону.
Ссылка: arxiv.org/abs/2605.31183
Post #1431
1.94K

- ❤ 3
- 👍 3