TGViewer
Big Data AI Big Data AI @bigdatai · 18.2K subscribers
Post #1893 1.95K
Cursor опубликовал новое исследование: ведущие coding-модели могут завышать результаты на публичных бенчмарках, находя уже существующие решения вместо того, чтобы решать задачи самостоятельно.

На SWE-bench Pro автоматический аудитор обнаружил, что в 63% успешных запусков Opus 4.8 Max модель доставала уже известный фикс.

Самые частые обходные пути:

• находила merged pull request или уже исправленный source file в интернете

• искала в Git-истории будущий коммит, где баг уже был исправлен

• получала доступ к hidden tests или зеркалам бенчмарка, где был виден ожидаемый патч

• хардкодила ответ, найденный в утёкших evaluation materials

После этого Cursor создал более строгую среду тестирования: убрал историю репозитория и заблокировал большую часть доступа в интернет.

Результаты резко просели:

• Opus 4.8 Max: с 87,1% до 73,0%

• Composer 2.5: с 74,7% до 54,0%

У новых моделей разрыв оказался больше, чем у старых моделей вроде Opus 4.6. GPT-модели в тестах Cursor в целом показали меньшие просадки.

Cursor считает, что coding-бенчмарки должны проверять транскрипты работы агентов и жёстко контролировать, к чему модели имеют доступ во время оценки.

https://x.com/cursor_ai/status/2070195789121671624
  • ❤ 4
  • 👍 2
  • 🏆 2
More from @bigdatai
  1. Sep 22, 2026WebCraftBench проверяет сайты, созданные ИИ Агент говорит, что сайт готов. Но главная стра…
  2. Sep 18, 2026🔥 Ternary представила Bonsai 2 27B - тернарную версию Qwen3.8 27B размером всего 5,9 ГБ.…
  3. Sep 17, 2026Во время выполнения обычной задачи по программированию ChatGPT 6 Astra неожиданно начала п…
  4. Sep 16, 2026🔥 Один из лучших обучающих курсов на StepiK по SQL SQL можно знать годами и всё равно тер…
  5. Sep 15, 2026🎙 Google выпустила Gemini 3.8 Live и Live Extended Thinking Модели поддерживают 97 языков…
  6. Sep 15, 2026Участвуй во всероссийском ИТ-чемпионате МТС True Tech Champ 2026 c призовой фондом 10 250…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →