TGViewer
Data Blog Data Blog @jdata_blog · 2.42K subscribers
Post #482 1.43K
Мне нравится слово интервенции.

Гугл с LLM-кой дает такой (конечно-же, cambridge-based) ouput — interventions есть действия, предпринимаемые для изменения ситуации, улучшения положения дел или предотвращения негативного развития событий.

И, так как негативных сценариев использования LLM можно придумать сколь угодно много, интервенции есть и для них. Сегодня — пост про них, с подборкой фремворков.

Прежде всего, говоря об интервенциях, следует различат два класса подходов:

1. Inference-time interventions (steering и смежные техники)
— не изменяют веса модели
— работают во время выполнения
— управляют поведением через представления

2. Parametric interventions (knowledge editing, fine-tuning)
— изменяют параметры модели
— влияют на “знания”, а не только на поведение
— имеют более устойчивый, но менее локальный эффект

У всех них есть наюнсы, проблемы и так далее, но прежде чем проблемы получить — предлагаю зафиксировать себе места, где их удобно искать =)

pyvene
Библиотека для интервенций и причинного анализа активаций
— activation patching, causal tracing
— проверка гипотез о репрезентациях
— подходит как для интерпретируемости, так и для экспериментов со steering

repeng
Читать через "реп" и будет у вас хорошее настроение. Для извлечения и применения steering-векторов
— построение направлений через полярные данные
— прямое применение в inference
— минималистичный инструментарий для activation steering

pyreft
Representation fine-tuning — что-то промежуточное между steering и fine-tuning
— обучение небольших модулей, влияющих на hidden states
— контроль поведения через обучаемые представления

EasyEdit
Редактирование знаний модели (knowledge editing) через параметры
— изменение конкретных фактов
— реализованы методы ROME, MEMIT и др. — если эти чудные слова вам о чем-либо говорят

EasySteer
Для activation steering, свежий фреймворк.
— упрощённое получение steering-векторов
— быстрый запуск экспериментов (за счет дружбы с vLLM)

NNsight
Контроль forward-pass модели во всех проекциях
— доступ к, перехват и модификация активаций
— batching interventions на несколько инпутов сразу
— ещё и skills repo есть, чтобы подтянуть агентов

Всеми не пользовалась, так что если у вас есть отзыв на какую-либо — welcome.

Ваш,
Дата автор!
GitHub GitHub - stanfordnlp/pyvene: Stanford NLP Python library for understanding and improving PyTorch models via interventions Stanford NLP Python library for understanding and improving PyTorch models via interventions - stanfordnlp/pyvene
  • ❤ 11
  • 🔥 6
  • 👍 3
More from @jdata_blog
  1. Sep 18, 2026А ещё вас стало невероятно сильно больше, и я безумно рада видеть новых людей (вы мой мале…
  2. Sep 18, 2026Третий момент, который мне прям вот захотелось записать-написать — это то, что надо это ло…
  3. Sep 18, 2026"AI решил выберите-проблему-математиков" Безумно обожаю, когда решаются какие-то сложные з…
  4. Sep 13, 2026Вебинар про объяснимость агентов и во что можно поиграть Как самый ответственный человек н…
  5. Sep 10, 2026Теперь официально: погнали пить кофе в Лондоне. 23 сентября выступаю на конференции Applie…
  6. Sep 4, 2026Вообще, я тут порефлексировала за лето, и поняла, что в канал надо постить кружки, чтобы о…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →