TGViewer
Препарируем LLM Препарируем LLM @nlp_with_heart · 382 subscribers
Post #21 825
Сегодня хочу рассказать о достаточно простой и короткой статье-туториале о способах интервенции модели.

Итак, наша мотивация довольно проста - определить, какие части модели отвечают за решение некоторой задачи. Так, в текущем посте сосредоточимся на задае factual recall. Например:

The Colloseum is in … ?


Модель должна продолжить словом Rome.

Такое простое задание требует от модели как минимум три навыка - работа с английским языком, определение, что речь идет о какой-то существующей локации, а также работа со связью Колизей <—> Рим (достопримечательность <—> местоположение). Чтобы найти, какие конкретно части модели отвечают за каждую из этих подзадач, мы можем модифицировать наш промпт чтобы явно проверять каждый из навыков (см. рисунок)

Допустим мы хотим понять, как модель работает с landmark recall. Возьмем промпт с другой локацией:

The Louvre is in …. ?


Гипотеза: при работе с обоими промптами будут срабатывать части модели, отвечающие конкретно за наш landmark recall. При этом, для второго промпта части, связанные конкретно с Колизеем и Римом, не будут активированы.

Однако чтобы именно определить что внутри модели заставляет ее выдавать Рим, нам придется «смешать» выходы (например, активации) нашей модели на этих промптах.

Продолжение⬇️
  • ❤ 4
More from @nlp_with_heart
  1. Oct 17, 2025Сегодня расскажу про нашу свежую статью «When Models Lie, We Learn: Multilingual Span-Leve…
  2. Oct 17, 2025Всем привет! Не освещала в своих постах кажется проблему галлюцинаций моделей, так что пор…
  3. Oct 2, 2025Исследователям надо было держать баланс между тем, чтобы а) тесты были корректным, осмысле…
  4. Oct 2, 2025Всем привет! Давно конечно было постов, так как я буквально пару дней назад приехала на уч…
  5. Sep 7, 2025Пару дней назад наткнулась на исследование о том, как конкретно дообучение LLM изменяет вн…
  6. Aug 22, 2025Вопрос «Как именно внутри LLM устроен reasoning?» остаётся достаточно сложным, но достаточ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →