TGViewer
Препарируем LLM Препарируем LLM @nlp_with_heart · 382 subscribers
Post #34 827
Исследователям надо было держать баланс между тем, чтобы
а) тесты были корректным, осмысленными и действительно проверяли ввод, а не просто были легкопроходимым заглушками;
б) в тестах не было регулярных выражений;
в) чтобы весь процесс, как определения признаков, так и вмешательство во время генерации было не очень долгим.


И как раз их метод SAE-based интервенеций лучше всего справился с тем, чтобы выдержать этот баланс (показано с помощью Pareto-dominance). Кроме того, у этого метода достаточно высокая точность — признак действительно активировался только на регулярные выражения. Интересно кстати, что у Gemma всего один признак полностью отвечал за появление регулярных выражений, в то время как у натренированного исслдеователями SAE для LLaMA таких признаков оказалось больше 50.

В качестве заключения, авторы еще раз подчеркивают, что данный метод не является специфичным и может быть применен к любым схожим задачам. Кроме того, у исследователей есть возможность самостоятельно проверять что найденный признак соотносится с нашими ожиданиями (с помощью Neuronpedia, см. картинку), что упрощает весь процесс и отнимает не так много времени на исследования и поиск гипотез, в отличии от других методов для решениях схожих задач.


Такая вот интересная работа, определенно надо пробовать применять SAE и к другим таким техническим задачам.


Ссылка на посте в блоге Tilde Research
  • 👍 6
  • 🔥 3
More from @nlp_with_heart
  1. Oct 17, 2025Сегодня расскажу про нашу свежую статью «When Models Lie, We Learn: Multilingual Span-Leve…
  2. Oct 17, 2025Всем привет! Не освещала в своих постах кажется проблему галлюцинаций моделей, так что пор…
  3. Oct 2, 2025Всем привет! Давно конечно было постов, так как я буквально пару дней назад приехала на уч…
  4. Sep 7, 2025Пару дней назад наткнулась на исследование о том, как конкретно дообучение LLM изменяет вн…
  5. Aug 22, 2025Вопрос «Как именно внутри LLM устроен reasoning?» остаётся достаточно сложным, но достаточ…
  6. Aug 10, 2025Тем не менее, на сегодняшний день SAE показывают результаты ниже ожидаемых в ряде задач. П…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →