TGViewer
Data Secrets Data Secrets @data_secrets · 94.6K subscribers
Post #9170 25.5K
Создатели SWE-bench представили новый бенчмарк по программированию, на котором абсолютно все современные модели выбивают ровно 0%

Он называется ProgramBench, и суть его проста: агент получает только скомпилированный исполняемый бинарник и документацию, и его задача – спроектировать код, который при сборке будет полностью соответствовать поведению исходного файла (без доступа к Интернету).

При этом агент должен самостоятельно определиться с архитектурой и выбрать структуру проекта. Собственно, здесь сложности и начинаются: LLM хорошо умеют писать плоский код в одном файле, а вот с многофайловыми проектами, где нужна низкоуровневая логика, работают плохо.

Итог: даже результат Claude Opus 4.7 и GPT-5.4 – это полный ноль.

Кажется, у нас новый претендент на звание самого интересного бенчмарка.

https://programbench.com/
  • 🔥 356
  • 😁 112
  • 👍 54
  • ❤ 28
  • 🗿 13
  • 🕊 2
  • 🤝 1
More from @data_secrets
  1. Oct 6, 2026На фоне жестких блокировок аккаунтов сегодня в Claude появилась поддержка русского языка �…
  2. Oct 6, 2026Google выпустила мультимодальную EmbeddingGemma 2 Первая версия работала только с текстом,…
  3. Oct 6, 2026Яндекс открыл код YTsaurus Flow — с ним алгоритмы быстрее замечают, что интересы пользоват…
  4. Oct 6, 2026Voici Le Chonk, un modèle à 1 000 milliards de paramètres Mistral представила новую флагма…
  5. Oct 6, 2026Голосование в Рейтинге работодателей hh.ru открыто! Год назад Авито вошёл в топ-3 лучших I…
  6. Oct 6, 2026Юра Борисов стал главным героем фильма про OpenAI Artificial наконец показали на Нью-Йоркс…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →