TGViewer
Машиннное обучение | Наука о данных Библиотека Машиннное обучение | Наука о данных Библиотека @machinelearning_books · 16.9K subscribers
Post #1431 1.94K
“Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines”

В статье утверждается, что sparse autoencoders, возможно, не такие уж плохие инструменты для steering, как считалось раньше. Значительная часть прошлых неудач могла быть связана не с самими автоэнкодерами, а с тем, что исследователи выбирали и называли неправильные признаки.

Проблема в том, что ранние работы выставляли sparse autoencoders слабыми: их features размечали так, что названия могли не совпадать с тем, что эти признаки реально вызывают внутри модели.

Sparse autoencoder - это небольшая вспомогательная модель, которая раскладывает скрытую активность LLM на множество возможных «признаков»: тему, стиль, концепт или другое внутреннее направление.

То есть sparse autoencoder может найти направление внутри модели, но неназванное направление ещё не становится удобной ручкой управления.

Авторы заменяют размытые или унаследованные названия supervised-пайплайном: они проверяют, действительно ли активность конкретного feature стабильно совпадает с реальной меткой в данных.

Механизм примерно такой: если feature срабатывает на тему «алкоголь», а искусственное усиление этого feature заставляет модель чаще говорить об алкоголе, то метка перестаёт быть просто описательной. У неё появляется причинный смысл.

Ещё один важный вывод: экстремальная разреженность может быть не обязательна. Feature не обязан быть сверхредким, чтобы быть полезным для steering.

Важно и сравнение с prompting. И prompting, и feature steering пытаются подтолкнуть LLM к нужному поведению.

Но prompting обычно сильнее, потому что модель специально обучали следовать промптам. Feature steering работает грубее: мы как будто напрямую нажимаем на внутренний механизм модели и надеемся, что остальная система не развалится.

Prompting говорит модели во входе: «напиши про алкоголь». Feature steering делает иначе: он усиливает внутренний «alcohol-related» feature и проверяет, сдвинется ли ответ в эту сторону.

Ссылка: arxiv.org/abs/2605.31183
  • ❤ 3
  • 👍 3
More from @machinelearning_books
  1. Sep 23, 2026Математика глубокого обучения в одном учебнике 737 страниц о математических основах Deep L…
  2. Sep 22, 2026Бесплатная книга по Physics-based Deep Learning 461-страничный учебник о применении глубок…
  3. Sep 21, 2026Лучший coding-агент провалил 76% реальных задач Новый бенчмарк τᵗ-bench проверяет не прост…
  4. Sep 18, 2026📚 MIT Advanced Data Structures - бесплатный продвинутый курс по структурам данных от MIT.…
  5. Sep 16, 2026✔️ xAI отозвала претензии к Apple, но продолжит судиться с OpenAI xAI и X Corp. подали в ф…
  6. Sep 15, 2026📘 Бесплатная 348-страничная книга по Machine Learning для учёных и инженеров Machine Lear…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →