TGViewer
Тест Тьюринга Тест Тьюринга @testuring · 2.13K subscribers
Post #2263 392
🤖 ИИ начал проверять научные статьи вместо людей

Hugging Face и стартап alphaXiv запустили трёхнедельный челлендж: заставить ИИ-агентов заново проверить итоги ICML 2026 — крупнейшей конференции по машинному обучению, прошедшей 6–11 июля в Сеуле и собравшей больше 6 тыс. статей.

Механика простая: участник берёт понравившуюся работу из программы, натравливает на неё кодового агента (Claude Code, Cursor, Codex, OpenCode) и пытается воспроизвести заявленные результаты — не в целом, а по отдельным пунктам-утверждениям, которые агент проверяет один за другим.

Организаторы ссылаются на давно обсуждаемую в индустрии цифру — до 70% публикаций по ИИ считаются невоспроизводимыми — и вместо того чтобы просто повторять её, решили проверить силами сообщества и агентных инструментов.

Технически всё построено вокруг Trackio от Hugging Face: участник авторизуется, ставит Trackio, подключает агента командой trackio skills add, открывает «логбук» для выбранной статьи и публикует в нём весь ход работы — какие эксперименты запускались, что пришлось упростить, что не воспроизвелось и что подтвердилось.

Логбук проверяет судья Logbook Judge, верифицированные попытки попадают на общий лидерборд. Несколько независимых воспроизведений одной статьи разными участниками не запрещены и даже приветствуются — так формируется открытая библиотека артефактов.

Челлендж стартовал продлится до 2 августа. За лучшие воспроизведения обещают до $4 тыс. в GPU-кредитах Hugging Face: первое место — $2 тыс., второе — $1 тыс., ещё по $500 двум призёрам, плюс $500 от партнёрского сервиса OpenResearch.


Первые 750 участников, зарегистрировавшихся и подавших заявку на кредит до 31 июля, получат по $20 стартового GPU-кредита, а каждый с хотя бы одним верифицированным логбуком — сертификат участия. По словам сооснователя Gradio Абубакара Абида, уже в первый день сообщество частично или полностью воспроизвело результаты 73 статей.

Зачем все это нужно?

Значимость события шире очередного агентного хакатона. Впервые предпринята попытка систематически, а не выборочно, проверить воспроизводимость целой научной конференции — силами сторонних агентов, которым заранее не показывали код авторов. Это одновременно тест для науки (выдерживают ли заявленные результаты независимую проверку) и тест для самих агентов — способны ли они разобраться в чужой методологии, а не просто прогнать готовый бенчмарк.

Механизм проверки вызывает вопросы: верификацию выполняет другая модель, Logbook Judge, и вопрос о надёжности самой проверки остаётся открытым. Организаторы это признают и оставляют финальное присуждение призов за ручным просмотром логбуков командой, а не только за баллами лидерборда. Участие не модерируется на входе, поэтому охват будет неровным: скорее воспроизведут популярные статьи, а работы с дорогим железом или закрытыми данными — вряд ли.

Даже с этими оговорками эксперимент важен не итоговым процентом воспроизведённых статей, а тем, что он впервые выкатывает рабочую инфраструктуру для системной проверки научных статей руками агентов и оставляет после себя открытую библиотеку результатов. Если приживётся формат, то из разового челленджа он может превратиться в регулярную практику для будущих конференций, дополняющую, а не заменяющую рецензирование.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
  • ❤ 2
  • 👍 2
  • 🔥 2
More from @testuring
  1. Sep 25, 2026🧬 Claude открыл неизвестную генетическую систему Anthropic запустила собственную группу п…
  2. Sep 24, 2026💊 Claude выходит в лабораторную науку Novo Nordisk и Anthropic заключили соглашение об ис…
  3. Sep 23, 2026ИИ, который не умеет генерить текст и картинки, но зато умеет выбирать Соавтор статьи об I…
  4. Sep 22, 2026🧪 Новый инструмент проверки научных гипотез AlphaXiv выпустила OpenResearch — открытую ра…
  5. Sep 21, 2026👿 Новости из Японии: снова оркестрация вместо одной гигантской ИИ-модели 11 сентября япон…
  6. Sep 18, 2026⚠️ ИИ уже нарушает правила, которые люди только начинают писать На этой неделе произошло с…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →