TGViewer
Препарируем LLM Препарируем LLM @nlp_with_heart · 374 subscribers
Post #29 860
Тем не менее, на сегодняшний день SAE показывают результаты ниже ожидаемых в ряде задач.

Первая из них — обнаружение концепций (concept detection). Суть в том, чтобы определить, присутствует ли в тексте заранее заданный концепт, например: «упоминается ли в тексте баскетболист?» или «есть ли в тексте позитивная эмоция?». Тут SAE уступают гораздо более простым подходам, таким как логистическая регрессия или даже просто прямой запрос к LLM.

Вторая задача — управление моделью (model steering). Предполагается, что изменяя внутренние представления модели, можно изменить ее поведение, например заставить LLM в ответе на вопрос упомянуть экономический кризис 2008 года. На практике же, прямое указание в промпте или дообучение модели работают куда лучше.

Однако, это не значит, что SAE — бесполезный инструмент, ведь обе эти задачи имеют общую особенность: концепт здесь подаётся на вход. Но по своему дизайну, SAE при отображении представления теряют часть информации, поэтому они и будут проигрывать методам, где такой потери нет. Если мы перейдем к задачам, где требуется найти в тексте новые, заранее неизвестные концепты, то увидим, что с ними SAE справляется гораздо лучше.

Так, например, в работе по генерации гипотез (hypothesis generation) исследователи взяли корпус новостных заголовков, каждый из которых имел числовую оценку вовлечённости читателей. SAE выделил и описал концепты, позволяющие предсказать этот уровень вовлечённости, гораздо лучше других методов. Таким образом, можно применять SAE в случае, когда необходимо описать естественным языком, что конкретно влияет на искомую переменную.

Вторая работа, в которой также концепты изначально не заданы, посвящена механике LLM (biology of LLMs). Задача заключалась в том, чтобы выявить, какие механизмы моделей активируются в процессе выполнения различных задач. Так, при решении примера «36 + 59» модель активировала нейрон «единицы = 5» и «40 + 50». А при написании стихотворения, если первая строка заканчивалась на слово «rabbit», сразу после её генерации включался нейрон «рифмуется с “it”».

Итого: в задачах, где нужно работать с заранее заданными концепциями, SAE проигрывают, в то время как в задачах с поиском новых, объясняющих задачу концептов, они показывают себя лучше остальных методов.

Статья
  • ❤ 12
  • 👍 1
More from @nlp_with_heart
  1. Oct 17, 2025Сегодня расскажу про нашу свежую статью «When Models Lie, We Learn: Multilingual Span-Leve…
  2. Oct 17, 2025Всем привет! Не освещала в своих постах кажется проблему галлюцинаций моделей, так что пор…
  3. Oct 2, 2025Исследователям надо было держать баланс между тем, чтобы а) тесты были корректным, осмысле…
  4. Oct 2, 2025Всем привет! Давно конечно было постов, так как я буквально пару дней назад приехала на уч…
  5. Sep 7, 2025Пару дней назад наткнулась на исследование о том, как конкретно дообучение LLM изменяет вн…
  6. Aug 22, 2025Вопрос «Как именно внутри LLM устроен reasoning?» остаётся достаточно сложным, но достаточ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →