TGViewer
Препарируем LLM Препарируем LLM @nlp_with_heart · 381 subscribers
Post #16 645
Сегодня напишу про то, как мы можем оценивать какие части модели влияют на определенное поведение

Из статьи Transformer Circuit Faithfulness Metrics Are Not Robust

Модель можно представить как вычислительный граф.

🟡Вершинами в зависимости от целей можно рассматривать разные сущности, так в языковых моделях обычно фокусируются на attention головах и на многослойных перцептронах (MLP), которые получают на вход информацию из голов. (см картинку)

🟡Ребрами графа буду являться связи между вершинами, т.е, ребро появляется, если одна из вершин передает что-то другой.

Если нам интересно как конкретно одна голова влияет на весь процесс, мы можем подменять ее выход и смотреть, как меняется поведение модели. Однако, в этом случае меняется и поведение всех последующих элементов, так как они теперь получают измененную информацию на вход, и, соотвественно могут совсем по другому ее обработать.
  • 🍌 1
More from @nlp_with_heart
  1. Oct 17, 2025Сегодня расскажу про нашу свежую статью «When Models Lie, We Learn: Multilingual Span-Leve…
  2. Oct 17, 2025Всем привет! Не освещала в своих постах кажется проблему галлюцинаций моделей, так что пор…
  3. Oct 2, 2025Исследователям надо было держать баланс между тем, чтобы а) тесты были корректным, осмысле…
  4. Oct 2, 2025Всем привет! Давно конечно было постов, так как я буквально пару дней назад приехала на уч…
  5. Sep 7, 2025Пару дней назад наткнулась на исследование о том, как конкретно дообучение LLM изменяет вн…
  6. Aug 22, 2025Вопрос «Как именно внутри LLM устроен reasoning?» остаётся достаточно сложным, но достаточ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →