TGViewer
ml phys ml phys @mlphys · 2.89K subscribers
Post #279 1.72K
Новый самый сложный бенчмарк для агентов

FrontierCode - benchmark для coding agents, где агенту дают сделать pull request в реальном репозитории, а дальше мейнтейнер репозитория решает, можно ли это мержить в main. В SWE-Bench итоговая оценка завязана на прохождение тестов. Тут критерий жёстче: принял бы такой PR мейнтейнер.

Сначала запускались юнит-тесты и стандартные проверки репозитория: build, lint, typecheck, style-checks и другие команды. Так устроены почти все coding-бенчмарки, и агенты уже неплохо научились это проходить. Отдельно проверяли тесты, которые написал сам агент: их запускали на старом коде, и они должны были падать. Если тест проходит до фикса, он не доказывает, что агент поймал исходную проблему.

Для каждой задачи мейнтейнеры заранее задавали конкретные ограничения проверки: какие файлы здесь допустимо менять, какие трогать нельзя, какой размер diff будет подозрительным, какие требования к стилю, архитектуре и поддерживаемости важны именно в этом месте кода. Эти пункты проверялись автоматически. Часть можно проверить обычным кодом: список файлов, размер diff, число изменённых строк. Часть проверял LLM-ревьюер: ему давали diff и текстовое требование, а он смотрел, соблюдён ли критерий. Например, в одной задаче агент вместо переиспользования общей функции LOG_WARNING() для логирования писал напрямую в stderr. Формально это работает и может проходить тесты, но PR всё равно плохой: код обходит общую логику проекта.

Лучше всех с большим отрывом показал себя Opus 4.8, но даже он пока далёк от стабильного end-to-end качества.
  • ❤ 7
More from @mlphys
  1. Sep 20, 2026Дайте астре почилить хотя бы в воскресенье
  2. Sep 16, 2026https://mimo.xiaomi.com/rl/ Риал тайм дашборд трейнинга новой модели сиаоми
  3. Sep 10, 2026Изи
  4. Sep 8, 2026Очередной benchmark забенчмаксили , причем всего с 14 до 28 процентов, почему все так хайп…
  5. Sep 3, 2026Agi is here?
  6. Sep 1, 2026Post #343
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →