TGViewer
Data Secrets Data Secrets @data_secrets · 94.2K subscribers
Post #9515 19.5K
SWE-Bench Pro умер и больше не подходит для измерения моделей, – расследование OpenAI

Некоторое время назад OpenAI выпустили статью, в которой заявили, что один из самых популярных бенчмарков для оценки способностй моделей в кодинге – SWE-bench Verified – больше не работает. Они нашли в нем кучу проблем, сказали, что результаты на нем мало чего стоят, и призвали всех переходить на SWE-Bench Pro. Подробности вот: t.me/data_secrets/8779.

Это было в конце февраля, менее 5 месяцев назад. И угадайте, что? Сейчас OpenAI объявили, что провели аналогичный тест для SWE-Bench Pro, и он... тоже оказался сломан.

В случае с SWE-bench Verified основная проблема состояла в том, что модели воспроизводят решения "по памяти" из-за утечек задач в обучающие датасеты. Здесь же проблема скорее в самих задачах. Дело в том, что issues и PR из опенсорсных репозиториев изначально создавались для человеческого сотрудничества через долгие переписки и уточнения, а вовсе не как изолированные, чистые задачи для оценки моделей. В частности, всплыли такие проблемы:

– Слишком строгие тесты, которые навязывают конкретные детали реализации, не указанные в условии задачи, из-за чего множество функционально корректных решений отбраковываются.
– Тесты с низким покрытием, которые, наоборот, недостаточно проверяют запрошенную функциональность, из-за чего неполные решения все равно проходят.
– Вводящие в заблуждение условия, которые направляют модель к неверному поведению или прямо противоречат тому, что требуют тесты.

OpenAI оценивает, что примерно 30% задач SWE-Bench Pro сломаны (автоматический пайплайн проверки пометил как испорченные 200 задач, а кампания ручной аннотации людьми – 249 задач, то есть 34,1%). Когда 1/3 задач бенчмарка – с такими ошибками в условиях, доверять ему сложно, поэтому OpenAI формально отзывает свою прежнюю рекомендацию использовать SWE-Bench Pro и "надеется, что сообщество разработает новые бенчмарки, созданные специально для тестирования возможностей моделей".

openai.com/index/separating-signal-from-noise-coding-evaluations/
  • 😁 94
  • ❤ 38
  • ⚡ 7
  • 👍 6
  • 🤯 3
  • 🕊 2
  • 💯 1
  • 🤨 1
  • 💘 1
  • 😎 1
More from @data_secrets
  1. Sep 29, 2026Ну вот и все, презентация подошла к концу. В сухом остатке имеем: — Новую GPT-6.1 Sol — Аг…
  2. Sep 29, 2026Еще из интересного – plugin extensions Это платформа, на которой можно будет находить, соз…
  3. Sep 29, 2026Тибо выдали специальную кнопку для ресетов (фото от @Futuris) 🤣 Один он уже выдал!
  4. Sep 29, 2026Все релизы с DevDay: https://openai.com/ru-RU/index/devday-2026-recap/
  5. Sep 29, 2026Еще для разработчиков: – Прокачали Codex Cloud. Теперь сессия не будет прерываться, когда…
  6. Sep 29, 2026Запустили Agent API Это та же технология и харнесс, на которых построен Codex и Dots, и те…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →