TGViewer
Pavel Zloi Pavel Zloi @evilfreelancer · 4.5K subscribers
Post #1840 2.27K
На канале @nlp_daily прочёл про бенчмарк SlopCodeBench (arxiv:2603.24755) в свеженьком посте.

Данный бенчмарк симулирует работу пользователя над некоей кодовой базой и тестирует слопность (переусложнённость и раздутость) кода который генерят модельки через свои кодовые агенты.

Циферки оригинальной работы есть на сайте лидерборда бенча, а вот тут можно про более свежие модели почитать, из всех имеющихся материалов я собрал для вас сводную инфографику одной картинкой.

Лучший результат у GPT 5.5, это 14% в строгом зачёте и 28% в изолированном, и ни одна модель не довела до конца ни одной задачи из двадцати. Свежие муравьиные модельки проблему не сильно исправили, на 17 чекпоинтах Opus 5 решает заметно больше соседей, 24% против 6%, но платит за это тройным объёмом кода, 29 тысяч строк против 9, и впятеро большим числом функций, при этом 93% строк всё равно триггерят слоп-правила.

Любопытный разрез по вендорам виден на левой нижней диаграмме. GPT и Codex занимают верхушку и в среднем меньше слопят код (эрозируют), а Opus и Sonnet решают прилично, но переусложняют код сильнее всех, вероятно в этом нюансе и сокрыта причина почти что религиозного противостояния между адептус клодкодус и хранителями кодекса.

Вполне ожидаемый вывод в том, что если дать агенту кодовую базу, над которой тот будет итеративно работать, решая проблему не сразу, а маленькими шажками, и вносить правки самостоятельно, ваша кодовая база, сюрприз, сюрприз, превратится в разбухшую кашу из лапшы и повторов, я конечно не кулинар, но аналогию думаю вы поняли.

Так что разговоры про агента, который сам хозяйничает в вашем репозитории длительное время без присмотра человека, это пока что сказки в пользу бедных.
  • 🔥 17
  • 👍 3
  • ❤ 1
More from @evilfreelancer
  1. Sep 20, 2026Post #1913
  2. Sep 18, 2026Чем дальше по пути развития кодовых агентов мы идем тем чаще замечаю, что с коллегами обме…
  3. Sep 17, 2026Меня тут ошарашили тем, что мой небольшой скил на базе учебника логики Челпанова для агент…
  4. Sep 17, 2026Представляю вашему вниманию Hub Defence! Игра в жанре Tower Defence о том, как Валера Кова…
  5. Sep 15, 2026Важное объявление! Сегодня 16.09.2026 c 00:00 до 04:00 MSK по всему neuraldeep.ru будут пр…
  6. Sep 13, 2026Увидел в чате ссылку на статью Тернарная нейронка на C# на Хабре и залип. Там автор собрал…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →