TGViewer
Технозаметки Малышева Технозаметки Малышева @tsingular · 12.9K subscribers
Post #8694 1.47K

Forwarded from Machinelearning

🌟 OpenScience: персональный учёный с режимом автономных экспериментов
Стартап Synthetic Sciences из зимнего набора Y Combinator 2026 года вывел на Product Hunt OpenScience – открытую рабочую среду с ИИ-агентом для научных исследований.

Сам агент компания выложила ещё в июле, а главное из обновления – режим Autoresearch, в котором агент без участия человека ставит серию экспериментов и улучшает заданную метрику.


OpenScience ведёт исследование целиком, от обзора литературы и гипотезы до кода, эксперимента, анализа и текста статьи.

Агенту доступны 295 встроенных навыков, от обучения моделей до молекулярной биологии, хемоинформатики и вёрстки в LaTeX, и около сорока научных баз, среди них UniProt, PDB, ChEMBL, PubChem, arXiv и Semantic Scholar.

🟡Механика

В Autoresearch задачу ставят обычными словами, например - снизить функцию потерь на валидационной выборке, остановить работу через час или при выходе метрики на плато и закончить после 20 запусков или 8 часов.

Агент сначала запускает базовый вариант, затем по очереди проверяет идеи, отсортированные по ожидаемой пользе, и по каждому запуску решает, сохранить изменение или откатить.

Чтобы цикл не затроил, после четырёх стартов без прогресса агент переключается на идеи другого типа, плюс каждые шесть запусков пересматривает подход.

Ход работы записывается в файлы с постановкой задачи, очередью идей, таблицей результатов и выводами.

Среда собрана как настольное приложение с деревом файлов, редактором, терминалом и просмотрщиками молекул, структур и геномов.

Модель выбирается, подойдут собственные ключи Anthropic, OpenAI, Google и других провайдеров, вход по подписке ChatGPT или Codex, локальные модели и фирменный сервис Ace.

Эксперименты запускаются локально, по SSH, в кластере под Slurm или PBS или в облаке Modal. Метрики собирает встроенный трекер, скрипты под wandb работают с ним без переделки.

🟡 Тесты

На Terminal-Bench Science агент решил 53 задачи из 70, это 75,7%.

В этом тесте OpenScience управляла GPT-6 Astra с GPT-6 Sol в роли исполнителей, на задачу давали 8 часов и одну попытку.

Лучший результат в таблице Snorkel – 68,1% у Codex с GPT-6 Astra, у Claude Code с Opus 5.5 там 63,3%.


В научной части Terminal-Bench 4.0 агент решил 10 задач из 14 против 60% у Claude Code с Fable 5.1, на BiomniBench-DA набрал 82,2 балла против 81,04 у aipoch.


📌Лицензирование: Apache 2.0


🟡Документация
🟡Бенчмарки
🟡Трассировки
🖥Github


@ai_machinelearning_big_data

#AI #ML #Agents #AiScientist #Bioinformatics #OpenScience
  • ⚡ 8
  • 🔥 3
  • ✍ 2
  • 👍 1
More from @tsingular
  1. Sep 29, 2026Microsoft явно вдохновленный самоорганизацией роев ИИ агентов при взломе Huggingface решил…
  2. Sep 29, 2026Ахаха https://dot.com/ Эта битва будет легендарной :) #OpenAI #XAI #Grok ------ @tsingular
  3. Sep 29, 2026Тем временем у входа на OpenAI DevDay #OpenAI ------ @tsingular
  4. Sep 29, 2026ну и, конечно, всем ресет! :) #OpenAI ——— @tsingular
  5. Sep 29, 2026Случилось то, о чем так долго говорили борщевики! OpenAI Marketplace! #OpenAI ——— @tsingul…
  6. Sep 29, 2026а вот это интересно. теперь можно свою подписку легально использовать в своих приложениях…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →