TGViewer
nlp_daily nlp_daily @nlp_daily · 2.17K subscribers
Post #297 2.41K
Все кодинг бенчмарки врут в одном и том же месте - выдают модели всё тз сразу. В жизни так не бывает: требования приезжают порциями, и код надо менять, не ломая уже сделанное. Но наконец-то появился честный бенчмарк от народа SlopCodeBench - тут постарались приблизиться к реалиям на земле: задача раскрывается чекпоинтами, модель на каждом шаге наследует свой же код без прошлого контекста, а зачёт дают, только если вместе с новыми тестами продолжают проходить и все старые

Через бенч прогоняли три модели клода (самый последний прогон) и наблюдали как агенты превращают кодовую базу в отборный слоп. Opus 5 выбил 24% чекпоинтов, Opus 4.8 и Sonnet 5 - по 6%, и ни одну задачу до конца не довёл никто (те до последнего чекпоинта)

Слоп кстати тоже потом меряют линейкой: детекторы клонов кода, обёрток-пустышек, try/except лесенок итд. Ну и все-таки есть прогресс поколений: опус 4.8 к концу доезжает до состояния, когда каждая шестая строка копия другой (копия имеется в виду структурная, а не дословная), а опус 5 держит строй - чуть больше 9% повторений. Промптами слоп не лечится, ни make no mistake, ни пиши чисто и планируй не помогают - разве только в начале

Ну и выводы автора бенча - пока модель не выбивает хотя бы 80%, оставлять агентов с кодом один на один рано, зато потом можно будет спокойно захлопнуть крышку гроба ноута и пойти домой и ждать перевода базового дохода на карточку.

За подгон материала спасибо Максу
  • 🔥 24
  • 👍 6
  • ❤ 2
  • 😎 2
More from @nlp_daily
  1. Sep 23, 2026Ролик создан Claude Opus 5.5, трек написан OpenAI Astra, сингулярность пришла сама
  2. Sep 23, 2026video post
  3. Sep 23, 2026Хорошо подумать следует кожаному Все советы бывалого по правильному промптингу новой модел…
  4. Sep 22, 2026Когда Дарио говорил, что пора тормозить, он имел в виду остальные лабы
  5. Sep 15, 2026photo post
  6. Sep 15, 2026Трамп позвонил Дженсену Хуангу прямо во время его выступления на All-In Summit и заявил, ч…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →