TGViewer
Технозаметки Малышева Технозаметки Малышева @tsingular · 13K subscribers
Post #8805 1.23K
HERMES уделал Codex и Claude Code

Команда из UIUC и Penn State выпустила статью с многообещающей acronym-расшифровкой: Harness Engineering foR software Engineering via Modular Executable Dev-Primitives.

Сразу оговорка: это академический фреймворк-тёзка, к Hermes Agent от Nous Research отношения не имеет.

Идея: вместо одного агента с раздутым контекстом каждый файл репозитория получает собственный вызов LLM.
Dev-Primitive оборачивает исходник, конфиг или тест резидентной моделью, и компонент сам отвечает за свой код, переговаривается с соседями по зависимостям и правит себя, диагностируя ошибки по трейсам.

🤖 Как работает: динамическая активация находит нужные компоненты задачи и тянет их зависимости, вместо тысяч файлов будится 5-13 штук.
Дальше раунд: примитивы правят свои артефакты и обмениваются требованиями на естественном языке, репозиторий исполняется, и если упал, механизм диагноза по stack trace возвращается к конкретным виновникам.
До трёх раундов.

📊 Результаты: на SWE-bench Verified обходит matched-бейзлайны в 19 из 20 конфигураций, в среднем +12,4 п.п. На Terminal-Bench 4.0 прокат GPT-5.6 Sol в Codex поднят с 33,0% до 51,8%, Terra с 18,2% до 44,5%. На миграции целого репозитория GPT-5.6 Sol в Codex показал 6,5%, в HERMES 31,0%: пятикратный рост. Claude Sonnet 5 и решает лучше, и токенов тратит меньше.

🔬 Главный инсайт статьи: масштаб модели решает по-разному для разных ролей. Усилить диагноз сильной моделью важнее, чем активацию, а сами примитивы можно оставить на Qwen3-8B: связка GPT-5.6 Sol активация + Qwen3-8B примитивы + GPT-5.6 Sol диагностика даёт 94,2% на SWE-bench, в 4,5 п.п. от полной GPT-5.6 Sol конфигурации, при цене на 26,2% ниже. Дешёвая модель правит файлы, дорогая думает.

💼 Зачем бизнесу: самописная обвязка переигрывает вендорские комбайны на их же моделях: Codex и Claude Code проигрывают до +26 п.п. при одинаковых бэкбонах. Прежде чем покупать следующий агент-комбайн, стоит спросить, что он делает с контекстом такого, чего нельзя собрать самим.

#HERMES #агенты #разработка #llm #оптимизация
———
@tsingular
  • ✍ 7
  • ❤ 2
  • ⚡ 1
  • 🔥 1
More from @tsingular
  1. Oct 9, 2026🔍 У Алисы в режиме «Эксперт» обнаружили сбой, похожий на GLM В опубликованном тесте Алису…
  2. Oct 9, 2026MLflow 3.17: быстрые Jev-судьи, права на отдельные трейсы и аналитика без ожидания 7 октяб…
  3. Oct 9, 2026Поставил Гермеса на ночь выучить книгу Джуди Картер,- "Новая библия комедии". Теперь он пр…
  4. Oct 8, 2026🚀 Google представил Gemini at Work 2026: главное с презентации Google Cloud показал масшт…
  5. Oct 8, 2026Лол, за абьюз своего Клода с 12 Ноября будут банить ☕️ что с лицом, кожаный
  6. Oct 8, 2026Это какой-то сюрр. https://truthsocial.com/@realDonaldTrump/posts/117406176604364910 #Trum…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →