Через бенч прогоняли три модели клода (самый последний прогон) и наблюдали как агенты превращают кодовую базу в отборный слоп. Opus 5 выбил 24% чекпоинтов, Opus 4.8 и Sonnet 5 - по 6%, и ни одну задачу до конца не довёл никто (те до последнего чекпоинта)
Слоп кстати тоже потом меряют линейкой: детекторы клонов кода, обёрток-пустышек, try/except лесенок итд. Ну и все-таки есть прогресс поколений: опус 4.8 к концу доезжает до состояния, когда каждая шестая строка копия другой (копия имеется в виду структурная, а не дословная), а опус 5 держит строй - чуть больше 9% повторений. Промптами слоп не лечится, ни make no mistake, ни пиши чисто и планируй не помогают - разве только в начале
Ну и выводы автора бенча - пока модель не выбивает хотя бы 80%, оставлять агентов с кодом один на один рано, зато потом можно будет спокойно захлопнуть крышку
За подгон материала спасибо Максу
