TGViewer
RoboFuture RoboFuture @robofuture · 4.92K subscribers
Post #121 2.73K
Поучаствовал в интересном соревновании - Enterprise RAG Challenge 3: AI Agents от Рината, автора канала LLM под капотом.

Мы с клодом заняли 7-ое место (среди 521 зарегистрированной команды)

В рамках соревнования нужно было разработать AI агента, который бы решал задачи в корпоративном сегменте, используя при этом 24 инструмента для взаимодействия с компанией.

Например, агенту поступает письмо от сотрудника: "Я ухожу в декрет, сотри все мои данные из системы" и агент должен решить, что предпринять - выполнить команду или, изучив корпоративную документацию (тоже через API), отклонить запрос. А может запросить согласование у начальника?


На решение всех задач у агентов было три часа (изначально час, но организаторы решили добавить еще два).

Мой агент был сделан на ванильной архитектуре ReAct от LangGraph и обогащен тремя дополнительными тулами:
* think tool
* planning tool
* critic tool со structured output
Работало все это на GPT-5.1 ($5 за прогон всех задач вышло)

Почему именно такая архитектура? Это по сути тот же универсальный агент на минималках. Я думаю, что будущее за такими агентами, в прошлом посте писал про это.

Про применение think-tool вместо классического reasoning я пару раз рассказывал в докладах и мне по-прежнему симпатичен этот подход.

Если быть честным, агент полностью навайбкожен с помощью Cursor + Claude Opus 4.5. Времени писать своего или даже вникать в его работу у меня не было, поэтому пошел следующим путем:

1. Задал текстом архитектуру (LangGraph + React + тулы)
2. Попросил сделать заготовку, которая бы позволяла прогонять задачи по-одному и генерировала бы разумное количество логов.
3. Прописал в файле AGENTS.md основные требования к агенту и базовые правила конкурса.
3. Запустил курсор в цикле, чтобы он запускал тестовые задачи по-одной и добивался бы прохождения каждого из тестов.

Здесь я оставил его на 4 часа (благо как раз была 90%-я скидка на Опус), в результате чего получил работающего агента.

Потом еще пару итераций по оптмизации, где я просил умную машину убрать оверфиты и байесы, а также обобщить промпты, чтобы агент был готов к новым типам задач.

В целом для меня это было не столько соервнование, сколько эксперимент - сможет ли курсор бустануть меня в такого рода соревновании. Кажется, он отлично справился, так как своих ресурсов я потратил очень мало. От меня только архитектура, остальное он сделал сам.

По ходу соревнования у меня был план (и я его придерживался) сделать прогон, попробовать подметить несколько основных проблем, исправить их с помощью вайб-кодинга и сделать еще один прогон. За время, отведенное на соревнование, успел это 1 раз проделать, но проблему визуально заметил только одну — агенту не хватало допустимого количества шагов (recursion limit).

Исходный код агента я опубликовал.

А еще это соревнование - шикарный агентный бенчмарк. Поскольку мой агент на LangChain, я собираюсь замерить на нем и другие модели, в том числе GigaChat и другие русские LLM-ки. Посмотрим как они себя покажут по сравнению с мировыми лидерами.

Например, за неделю, которая прошла с момента прогона, появилась GPT-5.2. Я провел еще один замер и метрика выросла с 0,515 до 0,630
  • 🔥 28
  • 👍 11
  • 👏 7
More from @robofuture
  1. Sep 17, 2026Последние дни развлекался с расцензуренным дипсиком V4.1 Flash - и слегка охренел, где у э…
  2. Sep 15, 2026Почему LLM обычно скептически относятся к астрологии и гомеопатии? Считается, что дело в S…
  3. Sep 5, 2026🐮 Вышла GPT-6 Astra, все с ней играются, я тоже поучаствую. Продолжаю серию с самым непре…
  4. Aug 15, 2026Вижу, что многие пришли к идее создавать себе несколько агентов-персонажей для ежедневной…
  5. Aug 4, 2026Похоже, тема применения агентов в повседневной жизни вам заходит. Тогда расскажу про ещё о…
  6. Jul 30, 2026📵 Вас тоже бесит, когда приложение шлет рекламные пуши, но заблокировать их нельзя, потом…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →