Пока был занят
адским трудом вышли новые Opus и Sol. В сети много неоднозначных сообщений, особенно про Sol 6. Поэтому решил пожечь лимиты и сделать небольшое сравнение.Все модели сравнивались на high effort:
🔴 Opus 5 vs Opus 5.5
🔴 Sol 5.6 vs Sol 6
🟡 Накидал 5 небольших "вайбкодинговых" задач, т.е. чисто - сделай хорошо, без спеки, чистый вайб. Стек TypeScript + Python.
🟡 Каждая модель решала каждую задачу дважды, итого 40 решений.
🟡 Каждый агент работал в своём изолированном контейнере и чистом окружении: без глобальных инструкций, без памяти, скиллов и веб-поиска.
🟡 Решения проверялись тестами, которых агенты не видели.
🟡 Оценка решений шла вслепую: имена моделей были вычищены, решения помечены буквами A–D, в каждом прогоне метки были перемешаны.
🟡 На каждое решение было два ревьюера xhigh: Opus 5.5 и Sol 6
🟡 Astra 6 был дополнительным верификатором и перепроверял замечания ревьюеров.
🟡 Fable 5.1 смотрел на этот цирк и ставил финальную оценку.
Критерии оценки (и вес):
🔗корректность (40%),
🔗edge cases (20%),
🔗качество кода (20%),
🔗 честность отчёта (20%).
Оценщики не видели времени выполнения и затраченные токены, чтобы это не влияло на оценку.
Выводы
🔵 Opus 5.5 заметно лучше Opus 5.
Выиграл 7 прогонов из 10 и был впереди во всех 5 задачах. При этом корректность у них +- одинаковая, но код у 5.5 чище и соразмернее задаче. При этом 5.5 в 2,5 раза быстрее и дешевле.
🔴Opus 5 раздувает решения (привет жадному Дарио). В одной из задач он написал 806 и 1223 LOC там, где остальным хватило 281–613 LOC. Зато у него оказались самые сильные собственные тесты.
🤩 Sol 6 и Sol 5.6 идут почти вровень, ничья 5:5 по здачам. При этом Sol 6 пишет компактнее и лучше справляется с неверным вводом, но его оценки сильнее скачут от прогона к прогону. Скорость и расход токенов у них одинаковые.
🟡Корректность у всех в порядке: основную часть скрытых тестов прошли все 40 решений. Модели различаются аккуратностью, надёжностью и честностью отчётов.
⚪️Opus и Sol между собой сравнивать нельзя. Ревьюер Sol ставит решениям Sol в среднем на 0,8 балла больше, чем ревьюер Opus. Надёжны только сравнения внутри пары.
🔘 Верификатор нужен. Ни одно из 70 серьёзных замечаний ревьюеров не оказалось ложным, но верификатор нашёл ещё 39 дефектов, которые оба ревьюера пропустили. Astra powagrh!
Всё-таки тест ограниченный. 10 прогонов на модель мало, хотя и достаточно, чтобы увидеть направление, но ничтожно для статистической значимости.
Если есть идеи, замечание, предложения и вам интересно что-то проверить - пишите в комментариях.