TGViewer
Книжный куб Книжный куб @book_cube · 15.7K subscribers
Post #4739 2.77K
ArchBench: хороший каркас, слабый лидерборд (Рубрика #Architecture)

Прочитал короткую работу "ArchBench: Benchmarking Generative-AI for Software Architecture Tasks". Идея здравая: собрать разрозненные evals для software architecture в одну расширяемую систему. Но на 19 июля 2026 года это скорее каркас будущего бенчмарка, чем рабочий лидерборд для выбора модели (можете сами оценить лидерборд на сайте бенча).

Команда SERC из индийского IIIT Hyderabad собрала открытую систему из CLI и React-сайта. Каждая задача - это плагин со своим загрузчиком данных, промптом, парсером и метриками. Общий конвейер проходит стадии загрузки, инференса и оценки, сохраняя промпты, сырые ответы, использование токенов и latency. Результаты и новые задачи предполагается принимать через PR.

Но наполнение у самого бенча слабое - всего 5 задач
- Генерация ADR (architecture decision records)
- Генерация serverless-компонентов
- Создание dynamic IoT сервисов
- Создание микросервисов
- Восстановление traceability
Эти задачи не покрывают архитектурный анализ, размышление о зависимостях, масштабный рефакторинг или работу с компромиссами. Причем end-to-end автоматизированы в CLI только написание ADR и восстановление traceability, а еще три таблицы с метриками перенесены из исходных исследований, их пайплайны для оценок пока интегрируются.

Метрики смешивают разные вещи
- ROUGE и BERTScore измеряют похожесть текста (для написания ADR)
- Test pass rate - функциональность кода при генерации сервисов и функций
Правда, это далеко от оценки качества архитектуры.
Агентных sandbox-окружений для использования инструментов у ребят пока нет пока нет.

Набор моделей тоже удивляет: GPT-3.5, старые GPT-4, Flan-T5/T0, CodeQwen и DeepSeek прежних поколений.
В генерации микросервисов есть Codex и Claude Code, но без точных версий и конфигураций, а значит сравнивать такие цифры сложно

Авторы отмечают, что рассчитывают на коммьюнити рост (вот GitHub бенча, если захотите законтрибьютить), но в публичной истории на 19 июля не видно внешних контрибьютов с новыми задачами или результатами моделей. После статьи менялись интерфейс и код, но не сам измерительный корпус.

Итого, этот бенч выглядит как концепт, но он станет реальным бенчом после расширения задач, полной автоматизации, запуска современных версионированных моделей и появления независимых участников. А пока это приглашение строить бенч.

#Architecture #AI #AI4SDLC #Evals #Research
  • ❤ 6
  • 👍 2
  • 🔥 1
More from @book_cube
  1. Oct 5, 2026SWE-agent или как интерфейс меняет результат / Research Insights Made Simple #33 (Рубрика…
  2. Oct 5, 2026Factory и HumanLayer: сколько самостоятельности отдавать агентам (Рубрика #AI4SDLC) Посмот…
  3. Oct 4, 2026Один дизайнер и сотни материалов (Рубрика #AI) В этом видео «One Designer + AI. Hundreds o…
  4. Oct 4, 20263 AImigo S1E8: AI-native компания — материалы выпуска (Рубрика #AI4SDLC) Собрал материалы…
  5. Oct 4, 2026В процессе подготовки к переезду начал разбирать книжки и освобождать свою библиотеку. Нат…
  6. Oct 4, 2026Stanford CME295, лекция 1: как текст становится вычислениями (Рубрика #AI) Первая лекция к…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →