Больше графов богу графов
Мне скинули свежий препринт: Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence.
TLDR: позиционируется агент-«учёный» (и нас заменят) для интерпретируемости, который ставится плагином к Клоду.
Стоит он на двух ресурсах — библиотеке из 32 исполняемых методов в 11 семействах и графе знаний.
Агент запускает четыре стадии:
1. Генерация гипотезы — запрос раскладывается на подзапросы, из двух графов знаний тянутся статьи, на выходе «атомарное утверждение» с планом проверки.
2. Эксперимент — выбирается метод из библиотеки, пишется и запускается код, перед полным прогоном идёт быстрая проверка вменяемости.
3. Верификация — отдельный агент проверяет эксперимент и пробует сломать вывод сменой метода, датасета и модели.
4. Итерация — независимое ревью внешней моделью (по дефолту GPT-5.4), возврат либо к гипотезе, либо к реализации, пока не кончится бюджет ревизий.
Память вынесена в файлы по стадиям (proposal, план, трекер, код, результаты, отчёты о целостности), что призвано сохранить читаемость шагов.
Жирным выделила детали — про них ниже (они важные в использовании).
Из п. 2: Проверка вменяемости — это флаг: сначала эксперимент ревьюится внешней моделью, потом гоняется самый дешёвый вариант эксперимента, трижды дебажится (и если не помогло — наконец-то всё падает).
Из п.3: Отдельный агент — это субагенты Клода внутри плагина, оркестратор раздаёт им стадии в одной сессии.
Из п.4: Внешняя модель подключается MCP-сервисом llm-chat через три переменные окружения — ключ, имя модели, base URL (годится любой OpenAI-совместимый). Требование одно: не Клод. Если ключ не настроен, ревью кода пропускается.
Самое вкусное, п. 1: Граф знаний и п.2 библиотека методов. Меня интересовали они, так как свой я тоже на днях отправила гулять в интернеты.
Что внутри: 13 936 статей, 33 400 авторов, 929 площадок. Семь типов рёбер из статьи: WRITTEN_BY→ Author, USES→ Technique, PUBLISHED_IN→ Venue, STUDIES→ Component, PROBES→ Ability, APPLIED_TO→ Scenario, TARGETS→ TargetModel.
(Venue я тоже хотела тянуть, но позже : ))
Источник: OpenAlex с фильтром на релевантность плюс блоги, названы Anthropic Research и Goodfire.
К каждой статье прицеплен 21 признак, извлечённый DeepSeek-V3.2 из абстракта: исследовательский вопрос, вклад, вывод, ключевые находки, ограничения, будущие направления, целевые модели, модальность. Плюс эмбеддинг заголовка и абстракта (bge-large-en-v1.5, 1024 измерения), проверка Claude Opus 4.7 и человеческая оценка на 100 статьях (90 %+ отмечено как корректные, но метрику согласия между аннотаторами не привели).
Если постараться, из графа можно вытащить статистики, нюансы и мета-инфу по базе данных.
— На сайте три узла фильтрации: методы и техники (как), объекты интерпретируемости (какая часть сети), приложение (где). Суммарно: техник 13 296, комопнент 7 138, сценариев 6 522. Это не количество статей, а именно количество раз, когда что-то описано в узле «техника/компонента/сценарий». На статью я насчитала 1.32 техники, потому она описана у 72% корпуса, а не у 95 %, если делить напрямую. Не менее 640 статей без техники, не менее 49 % без компонента, не менее 53 % без сценария.
— Классические до-механистические семейства (SHAP, градиентные методы, анализ величин) составляют до 26 % корпуса; — разреженные автоэнкодеры и поиск схем вместе — не более 7 %;
— Публично на сайте показаны 194 уникальные статьи. Отбор статей при поиске на сайте идёт по цитируемости из OpenAlex, и там что-то не так. «Toy Models of Superposition» в их данных стоит с 37 цитированиями, а в выдаче поиска с нулем при 944 на arXiv. Так что citation-ranked витрина тут может не работать.
Post #557
1.13K