TGViewer
LLM под капотом LLM под капотом @llm_under_hood · 29.3K subscribers
Post #704 12.5K
Время доказать, что есть архитектуры AI агентов лучше, чем SGR!

Вчера я выложил тестовый набор задач для соревнования ERC3. Там агенту нужно подрабатывать чатботом в небольшой международной компании с кучей APIшек, правилами безопасности и даже своей wiki. Заодно и выложил в Github пример простого агента, который выбивает 56.2.

Пока в лидерборде преобладают архитектуры на базе Schema-Guided Reasoning. Кто сможет сделать лучше? Хоть что, но не SGR. Или еще какой комбинированный подход.

Кстати, Валерий написал пост про то, как он взял 100

Соревнование 9 декабря будет заключаться в том, что я выложу в доступ 100 новых задач для того же агента. Нужно будет переключить своего агента на новый набор задач и запустить. Кто сможет получить больше очков за ~30 минут, тот и победил.

Платформа | Регистрация | Пример агента | Видео на русском

Кстати, а нужно отлаживать механизм переключения агента на новые задачи в рамках одной API-шки? Я могу выкатить ERC3-TEST со старыми задачами плюс еще парочкой новых посложнее. Заодно там и свой лидерборд будет))

Ваш, @llm_under_hood 🤗
  • 🔥 34
  • ❤ 12
  • 👍 10
  • 🤯 2
  • 😁 1
More from @llm_under_hood
  1. Sep 25, 2026Семь месяцев работы с Codex-ом в одном графике Это иллюстрация из моего поста про последни…
  2. Sep 24, 2026Период полураспада софта - 3 месяца Я сейчас возвращаюсь к сайту BitGN, чтобы начать подго…
  3. Sep 23, 2026Post #947
  4. Sep 22, 2026GPT-6 Sol и Luna - бенчмарк цены, качества и скорости А еще Opus 5.5 и Astra 6 (medium). В…
  5. Sep 22, 2026Доклад про DDD + AI в проектах (Berlin, 2025, EN) Не прошло и года с прошлого KanDDDinsky,…
  6. Sep 22, 2026LLM Benchmark Jev - топ для простых задач Jev - это новая LLM модель, в которую встроили S…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →