TGViewer
Data Blog Data Blog @jdata_blog · 2.4K subscribers
Post #557 1.13K
Больше графов богу графов

Мне скинули свежий препринт: Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence.

TLDR: позиционируется агент-«учёный» (и нас заменят) для интерпретируемости, который ставится плагином к Клоду.

Стоит он на двух ресурсах — библиотеке из 32 исполняемых методов в 11 семействах и графе знаний.

Агент запускает четыре стадии:

1. Генерация гипотезы — запрос раскладывается на подзапросы, из двух графов знаний тянутся статьи, на выходе «атомарное утверждение» с планом проверки.

2. Эксперимент — выбирается метод из библиотеки, пишется и запускается код, перед полным прогоном идёт быстрая проверка вменяемости.

3. Верификация — отдельный агент проверяет эксперимент и пробует сломать вывод сменой метода, датасета и модели.

4. Итерация — независимое ревью внешней моделью (по дефолту GPT-5.4), возврат либо к гипотезе, либо к реализации, пока не кончится бюджет ревизий.

Память вынесена в файлы по стадиям (proposal, план, трекер, код, результаты, отчёты о целостности), что призвано сохранить читаемость шагов.

Жирным выделила детали — про них ниже (они важные в использовании).

Из п. 2: Проверка вменяемости — это флаг: сначала эксперимент ревьюится внешней моделью, потом гоняется самый дешёвый вариант эксперимента, трижды дебажится (и если не помогло — наконец-то всё падает).

Из п.3: Отдельный агент
— это субагенты Клода внутри плагина, оркестратор раздаёт им стадии в одной сессии.

Из п.4: Внешняя модель подключается MCP-сервисом llm-chat через три переменные окружения — ключ, имя модели, base URL (годится любой OpenAI-совместимый). Требование одно: не Клод. Если ключ не настроен, ревью кода пропускается.

Самое вкусное, п. 1: Граф знаний и п.2 библиотека методов. Меня интересовали они, так как свой я тоже на днях отправила гулять в интернеты.

Что внутри: 13 936 статей, 33 400 авторов, 929 площадок. Семь типов рёбер из статьи: WRITTEN_BY→ Author, USES→ Technique, PUBLISHED_IN→ Venue, STUDIES→ Component, PROBES→ Ability, APPLIED_TO→ Scenario, TARGETS→ TargetModel.

(Venue я тоже хотела тянуть, но позже : ))

Источник: OpenAlex с фильтром на релевантность плюс блоги, названы Anthropic Research и Goodfire.

К каждой статье прицеплен 21 признак, извлечённый DeepSeek-V3.2 из абстракта: исследовательский вопрос, вклад, вывод, ключевые находки, ограничения, будущие направления, целевые модели, модальность. Плюс эмбеддинг заголовка и абстракта (bge-large-en-v1.5, 1024 измерения), проверка Claude Opus 4.7 и человеческая оценка на 100 статьях (90 %+ отмечено как корректные, но метрику согласия между аннотаторами не привели).

Если постараться, из графа можно вытащить статистики, нюансы и мета-инфу по базе данных.

— На сайте три узла фильтрации: методы и техники (как), объекты интерпретируемости (какая часть сети), приложение (где). Суммарно: техник 13 296, комопнент 7 138, сценариев 6 522. Это не количество статей, а именно количество раз, когда что-то описано в узле «техника/компонента/сценарий». На статью я насчитала 1.32 техники, потому она описана у 72% корпуса, а не у 95 %, если делить напрямую. Не менее 640 статей без техники, не менее 49 % без компонента, не менее 53 % без сценария.

— Классические до-механистические семейства (SHAP, градиентные методы, анализ величин) составляют до 26 % корпуса; — разреженные автоэнкодеры и поиск схем вместе — не более 7 %;

— Публично на сайте показаны 194 уникальные статьи. Отбор статей при поиске на сайте идёт по цитируемости из OpenAlex, и там что-то не так. «Toy Models of Superposition» в их данных стоит с 37 цитированиями, а в выдаче поиска с нулем при 944 на arXiv. Так что citation-ranked витрина тут может не работать.
arXiv.org Mechanist: AI as a Scientific Instrument for Discovering the... AI models are increasingly used in scientific discovery and human decision-making. Yet how AI models work and what risks they pose remain poorly understood. As AI development becomes faster and...
  • ❤ 3
  • 🔥 3
More from @jdata_blog
  1. Sep 18, 2026А ещё вас стало невероятно сильно больше, и я безумно рада видеть новых людей (вы мой мале…
  2. Sep 18, 2026Третий момент, который мне прям вот захотелось записать-написать — это то, что надо это ло…
  3. Sep 18, 2026"AI решил выберите-проблему-математиков" Безумно обожаю, когда решаются какие-то сложные з…
  4. Sep 13, 2026Вебинар про объяснимость агентов и во что можно поиграть Как самый ответственный человек н…
  5. Sep 10, 2026Теперь официально: погнали пить кофе в Лондоне. 23 сентября выступаю на конференции Applie…
  6. Sep 4, 2026Вообще, я тут порефлексировала за лето, и поняла, что в канал надо постить кружки, чтобы о…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →