TGViewer
LLM под капотом LLM под капотом @llm_under_hood · 29.2K subscribers
Post #718 11.6K
Вы круты!

Закончилась основная часть соревнования, где разные команды со всего мира вслепую решали сложные задачи корпоративной автоматизации при помощи AI:

- Leaderboard (призовой 3-х часовой раунд и extended round). Эти результаты заморожены навсегда. Я буду дополнять архитектуры описаниями и ссылками на решения (по мере поступления обновлений от команд). Но рейтинги уже меняться не будут.
- Финальный стрим

Бенчмарк теперь работает в публичном режиме, показывает подсказки и сразу оценивает работу агентов.

Этот бенчмарк гораздо сложнее реальных условий разворачивания AI агентов. В реальности есть возможность подкрутить промпты, добавить шорткаты, допилить агентов. А здесь у всех команд заранее был только доступ к корпоративному API. А компания за этим API открылась только в момент соревнования, со своими данными, корпоративной базой знаний и всякими CRM/ERP системами. Более того, на каждую задачу генерировалась с нуля своя небольшая вселенная. Ах, да, там еще были правила безопасности и попытки эту безопасность немного сломать.

Понятно, что не все задачи сделаны мной идеально, но для оценки уровня SotA в построении агентов - этого хватить должно.

Те, команды, агенты которых смогли выбить больше 40% accuracy вслепую в таких условиях, на реальных корпоративных условиях смогут показать точность выше 90%. Уже показывают.

Особенно круты те команды, которые использовали необычные архитектуры, локальные модели или даже разворачивали свое железо!

Спасибо вам! А теперь, давайте, посмотрим на лучшие результаты (см описания архитектур в лидерборде) и подтолкнем State of the Art еще дальше!

Ваш, @llm_under_hood 🤗


PS: Платформа остается, можно продолжать ей пользоваться. Вопрос с новыми регистрациями постараюсь решить на днях
YouTube Winners Announcement | Enterprise RAG Challenge 3 In this livestream, we officially announced the winning teams and top-performing AI agents of ERC3. Over the course of the challenge, teams from around the world built and evaluated AI agents under realistic enterprise conditions, competing across multiple…
  • 🔥 55
  • ❤ 29
  • 🎉 12
  • 👍 7
  • 👏 4
  • 🤯 2
  • 🥰 1
  • 😢 1
More from @llm_under_hood
  1. Sep 20, 2026Вчера я решил попрактиковать нативную разработку агентами. Для этого попросил Codex перепи…
  2. Sep 17, 2026Вдохновляющая история о том, как AI/LLM снижает порог вхождения в нишевые ниши Человеку бе…
  3. Sep 16, 2026Мои принципы командной AI Native разработки Главная цель тут - самостоятельность агентов п…
  4. Sep 14, 2026Встреча LLM под капотом в Нови Саде! Не ожидал, что столько людей откликнется, а некоторые…
  5. Sep 13, 2026Спонтанные посиделки в Novi Sad завтра? Как насчет встретиться завтра в Нови Саде (понедел…
  6. Sep 10, 2026Новым сайтом, агентом или еще каким приложением уже никого не удивить - это добра уже слиш…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →