TGViewer
Data Blog Data Blog @jdata_blog · 2.42K subscribers
Post #533 1.37K
XAI для агентов: библиотеки

Консерватор с тревожкой, когда кто-то что-то делает за него (я), наконец докопался до XAI для агентов.

Что у нас есть:

С агентами, вместо модели, нас интересует действие и их последовательность. Отсюда мы ставим вопрос: «почему был выбран этот путь/тула/шаг?». На текущем этапе развития интерпретируемости мы бы умерли, если бы тащили для ответа Mech-Interp, потому что у нас появляется гамбургер:

Агенты что-то делають.
[агенты-тусят]
Агент что-то сделаль.
[шаги-действий]
Модель, задающая мозг агента.
[о-веса-если-они-открыты]


Поэтому агентский XAI работает как привыкли в классике и использует в основном SHAP (SHapley Additive exPlanations).

Что это:

SHAP — супер-фундаментальный-в-XAI — метод из кооперативной теории игр. Идея на аналогиях — решить задачу справедливого разделения выигрыша между игроками. На выходе всегда вклад каждого игрока, хитро взвешенный на его участие. Классический SHAP всегда требует 2ⁿ прогонов, где n — число игроков. Можно протыкать по нему урок в free курсе (на русском).


В игровом подходе нас интересует то, что игроками могут быть разные штуки: сами агенты (когда их много — мультиагентная система), то, что они юзают, если мучаем одного агента (его инструменты) и то, что агент подтянул в контекст (документы в RAG).

В такой парадигме сейчас есть две либы:

AgentSHAP — Shapley-атрибуция важности инструментов агента через метод Монте-Карло (ММК). ММК оптимизирует 2ⁿ необходимость. Концептуально AgentSHAP дёргает только вход-выход и строит на этом распределение Shap. Проверок пока немного (по сути только в самой статье), и по людям кажется, ещё не разошлось. Плюс — без PyPI, надо клонировать локально (я уже; наиграюсь — сделаю туториал).

LLMX — возможно, статья на rebuttal =). Тоже «Shapley-атрибуция для RAG на минималках»: ShapleyAttributor считает вклад каждого извлечённого документа/куска контекста в вероятность конкретного ответа — прямой ответ на «что из контекста реально сработало» в RAG и мультиагентных пайплайнах.

Чем отличается от AgentSHAP:
Другие игроки: там инструменты агента, тут куски контекста. Второе — что считаем «выигрышем»: AgentSHAP смотрит на падение качества ответа (семантическая близость), а LLMX — на вероятность (log-prob), которую модель даёт нужному ответу. Плюс аппроксимация не только ММК, а целых пять. В том числе две основанные на суррогатах — линейных модельках.

Суррогат мне показался тоже прикольным на подсвет:
Вместо перебора коалиций гонят LLM на ~X случайных «масках» (какие куски контекста включены/выключены) и записывают, какая вероятность ответа вышла. На этих X примерах учат лёгкую линейную модельку «маска → результат», и её веса по каждому куску — это и есть атрибуция. В классическом XAI так работает LIME.


Что есть ещё:

Это без SHAP, но и не про интерпретируемость (интерпретируемость предполагает всегда оценку вклада сколь угодно уточненную от эмпирики каким-то методом, а все, что ниже — отслеживание эмпирического почему).

Docent — не вижу ничего лучше, чем назвать как "анализатор логов". Шага два:
DQL — фильтр-поиск по логам, типа «покажи все, где агент лез к файлам».
Reading-шаг — а на каждый вытащенный ран натравливается LLM, читает его и ставит метку / оценку / короткий пересказ (один ран = один запрос к модели).
Это всё Python-скрипты с кэшем. Я это делаю руками))

Petri — pipeline-версия для богатых — агент-аудитор, изучающий поведение целевой модели. Схема из трёх ролей: auditor ведёт многоходовый диалог (до 30 шагов, с симуляцией инструментов и откатами), target отвечает, judge размечает транскрипт. Target — целевая модель, Judge — ещё одна LLM. Работает, красиво, но дорого и долго.

AgentBoard — аналитическая eval-доска для multi-turn агентов: fine-grained progress rate, разбивка по сабскиллам и визуализация траекторий — видно, на каком шаге и почему агент сыпется, но без чиселки важности.
GitHub GitHub - GenAISHAP/TokenSHAP: A framework for interpreting modern AI systems using Monte Carlo Shapley value estimation. Model… A framework for interpreting modern AI systems using Monte Carlo Shapley value estimation. Model-agnostic explainability across language models, vision-language models, video understanding, and aut...
  • ❤ 14
  • 🔥 1
  • 💅 1
More from @jdata_blog
  1. Sep 18, 2026А ещё вас стало невероятно сильно больше, и я безумно рада видеть новых людей (вы мой мале…
  2. Sep 18, 2026Третий момент, который мне прям вот захотелось записать-написать — это то, что надо это ло…
  3. Sep 18, 2026"AI решил выберите-проблему-математиков" Безумно обожаю, когда решаются какие-то сложные з…
  4. Sep 13, 2026Вебинар про объяснимость агентов и во что можно поиграть Как самый ответственный человек н…
  5. Sep 10, 2026Теперь официально: погнали пить кофе в Лондоне. 23 сентября выступаю на конференции Applie…
  6. Sep 4, 2026Вообще, я тут порефлексировала за лето, и поняла, что в канал надо постить кружки, чтобы о…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →