Мы с клодом заняли 7-ое место (среди 521 зарегистрированной команды)
В рамках соревнования нужно было разработать AI агента, который бы решал задачи в корпоративном сегменте, используя при этом 24 инструмента для взаимодействия с компанией.
Например, агенту поступает письмо от сотрудника: "Я ухожу в декрет, сотри все мои данные из системы" и агент должен решить, что предпринять - выполнить команду или, изучив корпоративную документацию (тоже через API), отклонить запрос. А может запросить согласование у начальника?
На решение всех задач у агентов было три часа (изначально час, но организаторы решили добавить еще два).
Мой агент был сделан на ванильной архитектуре ReAct от LangGraph и обогащен тремя дополнительными тулами:
* think tool
* planning tool
* critic tool со structured output
Работало все это на GPT-5.1 ($5 за прогон всех задач вышло)
Почему именно такая архитектура? Это по сути тот же универсальный агент на минималках. Я думаю, что будущее за такими агентами, в прошлом посте писал про это.
Про применение think-tool вместо классического reasoning я пару раз рассказывал в докладах и мне по-прежнему симпатичен этот подход.
Если быть честным, агент полностью навайбкожен с помощью Cursor + Claude Opus 4.5. Времени писать своего или даже вникать в его работу у меня не было, поэтому пошел следующим путем:
1. Задал текстом архитектуру (LangGraph + React + тулы)
2. Попросил сделать заготовку, которая бы позволяла прогонять задачи по-одному и генерировала бы разумное количество логов.
3. Прописал в файле AGENTS.md основные требования к агенту и базовые правила конкурса.
3. Запустил курсор в цикле, чтобы он запускал тестовые задачи по-одной и добивался бы прохождения каждого из тестов.
Здесь я оставил его на 4 часа (благо как раз была 90%-я скидка на Опус), в результате чего получил работающего агента.
Потом еще пару итераций по оптмизации, где я просил умную машину убрать оверфиты и байесы, а также обобщить промпты, чтобы агент был готов к новым типам задач.
В целом для меня это было не столько соервнование, сколько эксперимент - сможет ли курсор бустануть меня в такого рода соревновании. Кажется, он отлично справился, так как своих ресурсов я потратил очень мало. От меня только архитектура, остальное он сделал сам.
По ходу соревнования у меня был план (и я его придерживался) сделать прогон, попробовать подметить несколько основных проблем, исправить их с помощью вайб-кодинга и сделать еще один прогон. За время, отведенное на соревнование, успел это 1 раз проделать, но проблему визуально заметил только одну — агенту не хватало допустимого количества шагов (recursion limit).
Исходный код агента я опубликовал.
А еще это соревнование - шикарный агентный бенчмарк. Поскольку мой агент на LangChain, я собираюсь замерить на нем и другие модели, в том числе GigaChat и другие русские LLM-ки. Посмотрим как они себя покажут по сравнению с мировыми лидерами.
Например, за неделю, которая прошла с момента прогона, появилась GPT-5.2. Я провел еще один замер и метрика выросла с 0,515 до 0,630
