— Дедупликация. Среди 194 витринных статей — четыре пары дублей, каждая с разным OpenAlex-ID и разной цитируемостью: «Knowledge Neurons in Pretrained Transformers» (125 и 42), «GANSpace: Discovering Interpretable GAN Controls» (425 и 356), «Visualizing and Understanding Neural Models in NLP» (535 и 166), «Constituency Parsing with a Self-Attentive Encoder» (484 и 44). Дедуп идёт по записям OpenAlex, а не по работам.
— В моём прогоне из 140 работ с геометрией в заголовке 39 совпали с корпусом, который я веду, а 101 — нет; правда, значительная их часть (neural collapse на игрушечных моделях, TDA-обвязка вокруг сетей, геометрия пространства параметров) лежит за рамками того, что я собираю.
Итого:
Работа классная! Если попробуете заставить агента что-то запустить и у вас получится, то пишите. По их собственным замерам агент работает: в статье отрепортили 16 статей для воспроизведения, девять тем, четыре измерения качества (работа с данными, дизайн, исполнение, анализ результатов), судьи — три человека плюс две модели. У Mechanist 87.2 / 83.3 / 92.2 / 86.5 % — на 9–13 пунктов выше «голого» Claude Code и на 31–38 пунктов выше AI Scientist.
Да и в целом, если вы работаете с литературой по интерпретируемости, Mechanist выглядит как "попробовать прикольно": бесплатный поиск по 14 тысячам статей с уже извлечёнными полями — вопрос, вклад, находки, ограничения, без ключей и регистрации и битых ссылок (наверное). Качество при этом нужно держать в уме (или коротко о том, почему я не релизнула БД карты сразу).
Всем желаю быть структурными, как граф! Попробую добивать и улучшать свой, чтобы открыть его нормальнее.
Ссылки: сайт, код и подробная документация для Mechanist.
Post #558
1.33K