TGViewer
gonzo-обзоры ML статей gonzo-обзоры ML статей @gonzo_ml · 24.4K subscribers
Post #6036 939
Ну, arxiv.org, берегись! Дороговато пока только. Но вопрос времени.

ScientistTwo: Pioneering the Human Knowledge Frontier with Autonomous AI
Jaehyun Nam, Jinsung Yoon, Yanzhou Pan, Yubo Wang, Rui Meng, Parthasarathy Ranganathan, Tomas Pfister
Paper: https://arxiv.org/abs/2609.19644
Review: https://arxiviq.substack.com/p/scientisttwo-pioneering-the-human
Code: https://scientist-two.github.io/
Model: N/A

ЧТО сделали: Авторы представили ScientistTwo — полностью автономный мультиагентный фреймворк для научных исследований, закрывающий весь цикл: от формулировки проблемы до готовой к публикации статьи и исполняемого репозитория. Развивая идеи своей предыдущей верификационной системы ScientistOne, ScientistTwo объединяет структурированную диагностику ограничений базовых методов, ранжирование гипотез по новизне, поэтапный отбор от сабсетов к полным бенчмаркам, доработку идей на основе абляций, а также автоматизированный замкнутый цикл рецензирования и экспериментального ребаттала. На 107 задачах из принятых статей ICLR, ICML и NeurIPS система автономно улучшила 80.4% человеческих SOTA-бейзлайнов со средним относительным приростом в 25.2%, генерируя препринты, проходящие порог принятия на топ-конференции по оценкам агентных рецензентов.

ПОЧЕМУ это важно: Предыдущие пайплайны автоматических открытий сводились либо к пассивному тюнингу гиперпараметров под единственную скалярную метрику на изолированном бенчмарке, либо страдали от нестабильности кода, скрытых компромиссов и галлюцинаций в тексте статей. ScientistTwo преодолевает разрыв между механической автоматизацией и академической строгостью: система изолирует причинно-следственный вклад каждого компонента через автоматические абляции и воспроизводит интерактивный процесс рецензирования, запуская дополнительные эксперименты в ответ на критику. Это наглядно показывает, что мультиагентные системы способны без вмешательства человека проводить многоэтапные доказательные исследования, формулируя, валидируя и защищая новые алгоритмические идеи.

Для практиков: Для руководителей исследований и ML-инженеров ScientistTwo предлагает готовый чертёж автономной исследовательской лаборатории. Вместо того чтобы использовать LLM лишь как чат-ассистентов для кодинга или саммаризации текстов, ScientistTwo объединяет специализированных агентов в структурированный коллектив. Получив на вход статью с топ-конференции, система выявляет архитектурные изъяны метода, проектирует новые решения, пишет и отлаживает код, подтверждает выигрыш на нескольких датасетах, изолирует источник улучшений с помощью абляций, оформляет статью и защищает её перед симулированными рецензентами новыми экспериментами. Результат в 80.4% успешных решений на более чем сотне задач машинного обучения задаёт новую планку в автоматизации полного цикла эмпирических исследований.

Генерировать статьи тут: https://t.me/gonzo_ML_podcasts/4808
arXiv.org ScientistTwo: Pioneering the Human Knowledge Frontier with Autonomous AI Scientific discovery is defined by the ability to identify the boundaries of existing knowledge and venture into unexplored territory. The ultimate vision for AI in science is problem-driven...
  • 👍 11
  • 🎉 2
  • 🤮 1
More from @gonzo_ml
  1. Sep 25, 2026photo post
  2. Sep 25, 2026photo post
  3. Sep 25, 2026photo post
  4. Sep 24, 2026Красивое https://epoch.ai/publications/the-plunging-price-of-thought
  5. Sep 24, 2026photo post
  6. Sep 24, 2026photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →