Hugging Face и стартап alphaXiv запустили трёхнедельный челлендж: заставить ИИ-агентов заново проверить итоги ICML 2026 — крупнейшей конференции по машинному обучению, прошедшей 6–11 июля в Сеуле и собравшей больше 6 тыс. статей.
Механика простая: участник берёт понравившуюся работу из программы, натравливает на неё кодового агента (Claude Code, Cursor, Codex, OpenCode) и пытается воспроизвести заявленные результаты — не в целом, а по отдельным пунктам-утверждениям, которые агент проверяет один за другим.
Организаторы ссылаются на давно обсуждаемую в индустрии цифру — до 70% публикаций по ИИ считаются невоспроизводимыми — и вместо того чтобы просто повторять её, решили проверить силами сообщества и агентных инструментов.
Технически всё построено вокруг Trackio от Hugging Face: участник авторизуется, ставит Trackio, подключает агента командой trackio skills add, открывает «логбук» для выбранной статьи и публикует в нём весь ход работы — какие эксперименты запускались, что пришлось упростить, что не воспроизвелось и что подтвердилось.
Логбук проверяет судья Logbook Judge, верифицированные попытки попадают на общий лидерборд. Несколько независимых воспроизведений одной статьи разными участниками не запрещены и даже приветствуются — так формируется открытая библиотека артефактов.
Челлендж стартовал продлится до 2 августа. За лучшие воспроизведения обещают до $4 тыс. в GPU-кредитах Hugging Face: первое место — $2 тыс., второе — $1 тыс., ещё по $500 двум призёрам, плюс $500 от партнёрского сервиса OpenResearch.
Первые 750 участников, зарегистрировавшихся и подавших заявку на кредит до 31 июля, получат по $20 стартового GPU-кредита, а каждый с хотя бы одним верифицированным логбуком — сертификат участия. По словам сооснователя Gradio Абубакара Абида, уже в первый день сообщество частично или полностью воспроизвело результаты 73 статей.
Зачем все это нужно?
Значимость события шире очередного агентного хакатона. Впервые предпринята попытка систематически, а не выборочно, проверить воспроизводимость целой научной конференции — силами сторонних агентов, которым заранее не показывали код авторов. Это одновременно тест для науки (выдерживают ли заявленные результаты независимую проверку) и тест для самих агентов — способны ли они разобраться в чужой методологии, а не просто прогнать готовый бенчмарк.
Механизм проверки вызывает вопросы: верификацию выполняет другая модель, Logbook Judge, и вопрос о надёжности самой проверки остаётся открытым. Организаторы это признают и оставляют финальное присуждение призов за ручным просмотром логбуков командой, а не только за баллами лидерборда. Участие не модерируется на входе, поэтому охват будет неровным: скорее воспроизведут популярные статьи, а работы с дорогим железом или закрытыми данными — вряд ли.
Даже с этими оговорками эксперимент важен не итоговым процентом воспроизведённых статей, а тем, что он впервые выкатывает рабочую инфраструктуру для системной проверки научных статей руками агентов и оставляет после себя открытую библиотеку результатов. Если приживётся формат, то из разового челленджа он может превратиться в регулярную практику для будущих конференций, дополняющую, а не заменяющую рецензирование.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
