TGViewer
Data Secrets Data Secrets @data_secrets · 94.3K subscribers
Post #8779 25.5K
OpenAI отменили SWE-bench Verified – главный современный бенчмарк по кодингу

Они выпустили целое исследование, основная мысль которого: SWE-bench Verified (который сделали, кстати, сами OpenAI в 2024) больше не измеряет реальные способности моделей в разработке, и пользоваться им не стоит.

Кстати, это выглядит как косвенный выпад в сторону Anthropic. Они там до сих пор делают ставку на SWE Verified, а OpenAI фактически приходят и заявляют, что этот бенч сломан и результаты на нем мало что значат. На фоне последних событий это вряд ли случайность 💀

В чем, собственно, проблема SWE-bench Verified:

1️⃣ Тесты часто отбрасывают корректные решения. OpenAI сделали ручной аудит сложных задач и выяснили, что в 59.4% этих задач есть проблемы тест-дизайна/описания, из-за которых задачу становится крайне трудно или вообще невозможно решить честно, даже человеку.

Например, тесты требуют конкретных деталей реализации, которые не обязательны для функционально верного решения. Или тесты проверяют дополнительную функциональность, которая не описана в задаче. В таких случаях эвал, очевидно, становится некорректным.

2️⃣ Классический contamination, то есть утечка задач в трейн моделей. Бенчмарк собран из опенсорс репозиториев, так что этого стоило ожидать. OpenAI пишут, что нашли признаки contamination у всех фронтирных моделей, которые они тестировали.

В частности, выяснилось, что GPT-5.2, Claude Opus 4.5 и Gemini 3 Flash Preview знают не только точный gold patch для решения, но и воспроизводят точные пути к файлам, цитируют комментарии из диффа или просто по ID могут вспомнить формулировку задачи.

Итого вывод OpenAI следующий: тесты часто неправильно устроены, так что нерешаемый хвост бенчмарка – это шум, сражаться за который не стоит. А если процент и растет, то это в основном узнавание, а не рост реальных навыков.

Вместо SWE-bench Verified они теперь советуют SWE-bench Pro (у него тоже все не идеально, но по их данным contamination там заметно слабее, и ни одна модель не смогла воспроизвести полный gold patch дословно). Фишка, правда, в том, что SWE-bench Pro открыт только частично, и чтобы получить на нем официальный результат, нужно проходить через организаторов. То есть, через OpenAI 🙂

openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/
  • 😁 178
  • 🔥 23
  • 👍 17
  • ❤ 16
  • 🤯 3
  • ☃ 2
  • 🤔 2
  • 🗿 2
  • 🤗 1
More from @data_secrets
  1. Sep 30, 2026Герой дня – Дарио Амодеи на свежем репортаже из Белого Дома, где техлидеры обсуждали контр…
  2. Sep 29, 2026Ну вот и все, презентация подошла к концу. В сухом остатке имеем: — Новую GPT-6.1 Sol — Аг…
  3. Sep 29, 2026Еще из интересного – plugin extensions Это платформа, на которой можно будет находить, соз…
  4. Sep 29, 2026Тибо выдали специальную кнопку для ресетов (фото от @Futuris) 🤣 Один он уже выдал!
  5. Sep 29, 2026Все релизы с DevDay: https://openai.com/ru-RU/index/devday-2026-recap/
  6. Sep 29, 2026Еще для разработчиков: – Прокачали Codex Cloud. Теперь сессия не будет прерываться, когда…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →