Ну, arxiv.org, берегись! Дороговато пока только. Но вопрос времени.
ScientistTwo: Pioneering the Human Knowledge Frontier with Autonomous AI
Jaehyun Nam, Jinsung Yoon, Yanzhou Pan, Yubo Wang, Rui Meng, Parthasarathy Ranganathan, Tomas Pfister
Paper: https://arxiv.org/abs/2609.19644
Review: https://arxiviq.substack.com/p/scientisttwo-pioneering-the-human
Code: https://scientist-two.github.io/
Model: N/A
ЧТО сделали: Авторы представили ScientistTwo — полностью автономный мультиагентный фреймворк для научных исследований, закрывающий весь цикл: от формулировки проблемы до готовой к публикации статьи и исполняемого репозитория. Развивая идеи своей предыдущей верификационной системы ScientistOne, ScientistTwo объединяет структурированную диагностику ограничений базовых методов, ранжирование гипотез по новизне, поэтапный отбор от сабсетов к полным бенчмаркам, доработку идей на основе абляций, а также автоматизированный замкнутый цикл рецензирования и экспериментального ребаттала. На 107 задачах из принятых статей ICLR, ICML и NeurIPS система автономно улучшила 80.4% человеческих SOTA-бейзлайнов со средним относительным приростом в 25.2%, генерируя препринты, проходящие порог принятия на топ-конференции по оценкам агентных рецензентов.
ПОЧЕМУ это важно: Предыдущие пайплайны автоматических открытий сводились либо к пассивному тюнингу гиперпараметров под единственную скалярную метрику на изолированном бенчмарке, либо страдали от нестабильности кода, скрытых компромиссов и галлюцинаций в тексте статей. ScientistTwo преодолевает разрыв между механической автоматизацией и академической строгостью: система изолирует причинно-следственный вклад каждого компонента через автоматические абляции и воспроизводит интерактивный процесс рецензирования, запуская дополнительные эксперименты в ответ на критику. Это наглядно показывает, что мультиагентные системы способны без вмешательства человека проводить многоэтапные доказательные исследования, формулируя, валидируя и защищая новые алгоритмические идеи.
Для практиков: Для руководителей исследований и ML-инженеров ScientistTwo предлагает готовый чертёж автономной исследовательской лаборатории. Вместо того чтобы использовать LLM лишь как чат-ассистентов для кодинга или саммаризации текстов, ScientistTwo объединяет специализированных агентов в структурированный коллектив. Получив на вход статью с топ-конференции, система выявляет архитектурные изъяны метода, проектирует новые решения, пишет и отлаживает код, подтверждает выигрыш на нескольких датасетах, изолирует источник улучшений с помощью абляций, оформляет статью и защищает её перед симулированными рецензентами новыми экспериментами. Результат в 80.4% успешных решений на более чем сотне задач машинного обучения задаёт новую планку в автоматизации полного цикла эмпирических исследований.
Генерировать статьи тут: https://t.me/gonzo_ML_podcasts/4808
Post #6036
939