TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 279K subscribers
Post #11035 10.8K
🌟 OpenScience: персональный учёный с режимом автономных экспериментов
Стартап Synthetic Sciences из зимнего набора Y Combinator 2026 года вывел на Product Hunt OpenScience – открытую рабочую среду с ИИ-агентом для научных исследований.

Сам агент компания выложила ещё в июле, а главное из обновления – режим Autoresearch, в котором агент без участия человека ставит серию экспериментов и улучшает заданную метрику.


OpenScience ведёт исследование целиком, от обзора литературы и гипотезы до кода, эксперимента, анализа и текста статьи.

Агенту доступны 295 встроенных навыков, от обучения моделей до молекулярной биологии, хемоинформатики и вёрстки в LaTeX, и около сорока научных баз, среди них UniProt, PDB, ChEMBL, PubChem, arXiv и Semantic Scholar.

🟡Механика

В Autoresearch задачу ставят обычными словами, например - снизить функцию потерь на валидационной выборке, остановить работу через час или при выходе метрики на плато и закончить после 20 запусков или 8 часов.

Агент сначала запускает базовый вариант, затем по очереди проверяет идеи, отсортированные по ожидаемой пользе, и по каждому запуску решает, сохранить изменение или откатить.

Чтобы цикл не затроил, после четырёх стартов без прогресса агент переключается на идеи другого типа, плюс каждые шесть запусков пересматривает подход.

Ход работы записывается в файлы с постановкой задачи, очередью идей, таблицей результатов и выводами.

Среда собрана как настольное приложение с деревом файлов, редактором, терминалом и просмотрщиками молекул, структур и геномов.

Модель выбирается, подойдут собственные ключи Anthropic, OpenAI, Google и других провайдеров, вход по подписке ChatGPT или Codex, локальные модели и фирменный сервис Ace.

Эксперименты запускаются локально, по SSH, в кластере под Slurm или PBS или в облаке Modal. Метрики собирает встроенный трекер, скрипты под wandb работают с ним без переделки.

🟡 Тесты

На Terminal-Bench Science агент решил 53 задачи из 70, это 75,7%.

В этом тесте OpenScience управляла GPT-6 Astra с GPT-6 Sol в роли исполнителей, на задачу давали 8 часов и одну попытку.

Лучший результат в таблице Snorkel – 68,1% у Codex с GPT-6 Astra, у Claude Code с Opus 5.5 там 63,3%.


В научной части Terminal-Bench 4.0 агент решил 10 задач из 14 против 60% у Claude Code с Fable 5.1, на BiomniBench-DA набрал 82,2 балла против 81,04 у aipoch.


📌Лицензирование: Apache 2.0


🟡Документация
🟡Бенчмарки
🟡Трассировки
🖥Github


@ai_machinelearning_big_data

#AI #ML #Agents #AiScientist #Bioinformatics #OpenScience
  • 👍 51
  • 🔥 14
  • 👏 10
  • 🤓 9
  • 🤩 6
  • 🥰 5
  • ❤ 3
More from @ai_machinelearning_big_data
  1. Sep 29, 2026✔️ Агенты OpenAI выложили в сеть 53 фото пользователей Изображения пользователи загружали…
  2. Sep 29, 2026⚡️ ML-пайплайн больше не обязательно собирать внутри одной площадки Эксперименты и вычисли…
  3. Sep 28, 2026⚡️ Claude Sonnet 5.5 Sonnet 5.5 - вторая модель линейки 5.5 после Opus 5.5. Anthropic пози…
  4. Sep 28, 2026📌 Dream-RSI: агент улучшает стратегию поиска решений на основе прошлых запусков Google оп…
  5. Sep 28, 2026🦾 Практический RecSys: собери рекомендательную ленту с помощью ML — на бесплатном вебинар…
  6. Sep 28, 2026🤖 Робот сначала ошибается в симуляции, а потом исправляет движение до попытки в реальном…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →