TGViewer
Сиолошная Сиолошная @seeallochnaya · 80.3K subscribers
Post #3604 25.5K
Вчера вышел бенчмарк для кодинг-агентов ProgramBench от авторов SWE-Bench, на который мы будем смотреть ближайший год+.

Задача агента — воспроизвести код уже готовой программы, имея доступ к скомпилированному бинарному файлу и пользовательской документации. То есть агенту условно дают SQLite и говорят «вот сделай так же, те же интерфейсы, те же фичи». В первичном релизе — 200 программ из открытых репозиториев, от тех, про которые никто не слышал (<500 звезд на гитхабе) до того же SQLite, запущенного на каждом смартфоне.

Одна из самых интересных частей бенчмарка — это описание того, как его собирали и как проверяют выполнение задачи. Репозитории GitHub, подходящие под некоторые критерии, отдают LLM-агенту и промптят а) запустить инструкции по сборке (чтобы получить программу в точности соответствующую коду) б) сгенерировать возможные сценарии использования на основе кода + документации. Для этого агента запускают в цикле и не останавливают, пока процент покрытия кода тестами не будет высоким. Тесты также фильтруются (если их проходит и пустое приложение) и переписываются (например, если их не проходит сама оригинальная программа).

Получается авторазметка кодинг-агентами.

Мединный проект из этих 200 содержит 8700 строк кода в 50 файлах, 770 тестов, 2100 звезд и был впервые опубликован 8 лет назад.

Основная метрика — доля проектов, которые агент может воспроизвести так, что проходит 100% тестов. Дополнительная метрика — то же самое, но с порогом в 95% тестов.

У агента есть 6 часов, 1000 шагов и неограниченное количество запросов к скомпилированной программе.

У авторов получилось, что на данный момент все модели набирают 0% по основной метрике, а Opus 4.7 лидирует по дополнительной с результатом в 3%.
  • 🔥 164
  • 👍 46
  • 🤔 26
  • 👨‍💻 9
  • 🤯 6
  • ❤‍🔥 3
  • 💩 3
  • 🤡 3
  • 👎 2
More from @seeallochnaya
  1. Oct 5, 2026В мире с миллиардом Эйнштейнов кому-то всё равно придётся строить лаборатории и вести бухг…
  2. Sep 30, 2026Post #3976
  3. Sep 30, 2026Нежданно негаданно Google представили Gemini 4 Argon Доступа пока нет, выкатят на всех ког…
  4. Sep 29, 2026Пока рассказывают про Grok Bot и Muse— в документации уже указано, что: 1) да, будет тир з…
  5. Sep 29, 2026OpenAI DevDay через 10 минут: https://www.youtube.com/watch?v=Fls_onRviPM Обещают более 20…
  6. Sep 29, 2026Утром Tibo написал, что сегодня вернут подписки ChatGPT за $200... но есть одно "но": в ни…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →