TGViewer
Циничный AI Циничный AI @cinicai · 234 subscribers
Post #186 145
🚬 Мини-эвала Opus 5 vs 5.5 и Sol 5.6 vs 6 пост

Пока был занят адским трудом вышли новые Opus и Sol. В сети много неоднозначных сообщений, особенно про Sol 6. Поэтому решил пожечь лимиты и сделать небольшое сравнение.

Все модели сравнивались на high effort:
🔴 Opus 5 vs Opus 5.5
🔴 Sol 5.6 vs Sol 6

🟡 Накидал 5 небольших "вайбкодинговых" задач, т.е. чисто - сделай хорошо, без спеки, чистый вайб. Стек TypeScript + Python.
🟡 Каждая модель решала каждую задачу дважды, итого 40 решений.
🟡 Каждый агент работал в своём изолированном контейнере и чистом окружении: без глобальных инструкций, без памяти, скиллов и веб-поиска.
🟡 Решения проверялись тестами, которых агенты не видели.
🟡 Оценка решений шла вслепую: имена моделей были вычищены, решения помечены буквами A–D, в каждом прогоне метки были перемешаны.
🟡 На каждое решение было два ревьюера xhigh: Opus 5.5 и Sol 6
🟡 Astra 6 был дополнительным верификатором и перепроверял замечания ревьюеров.
🟡 Fable 5.1 смотрел на этот цирк и ставил финальную оценку.

Критерии оценки (и вес):
🔗корректность (40%),
🔗edge cases (20%),
🔗качество кода (20%),
🔗 честность отчёта (20%).

Оценщики не видели времени выполнения и затраченные токены, чтобы это не влияло на оценку.

Выводы
🔵 Opus 5.5 заметно лучше Opus 5.
Выиграл 7 прогонов из 10 и был впереди во всех 5 задачах. При этом корректность у них +- одинаковая, но код у 5.5 чище и соразмернее задаче. При этом 5.5 в 2,5 раза быстрее и дешевле.

🔴Opus 5 раздувает решения (привет жадному Дарио). В одной из задач он написал 806 и 1223 LOC там, где остальным хватило 281–613 LOC. Зато у него оказались самые сильные собственные тесты.

🤩 Sol 6 и Sol 5.6 идут почти вровень, ничья 5:5 по здачам. При этом Sol 6 пишет компактнее и лучше справляется с неверным вводом, но его оценки сильнее скачут от прогона к прогону. Скорость и расход токенов у них одинаковые.

🟡Корректность у всех в порядке: основную часть скрытых тестов прошли все 40 решений. Модели различаются аккуратностью, надёжностью и честностью отчётов.

⚪️Opus и Sol между собой сравнивать нельзя. Ревьюер Sol ставит решениям Sol в среднем на 0,8 балла больше, чем ревьюер Opus. Надёжны только сравнения внутри пары.

🔘 Верификатор нужен. Ни одно из 70 серьёзных замечаний ревьюеров не оказалось ложным, но верификатор нашёл ещё 39 дефектов, которые оба ревьюера пропустили. Astra powagrh!

Всё-таки тест ограниченный. 10 прогонов на модель мало, хотя и достаточно, чтобы увидеть направление, но ничтожно для статистической значимости.

Если есть идеи, замечание, предложения и вам интересно что-то проверить - пишите в комментариях.
  • 🔥 6
  • 👍 2
More from @cinicai
  1. Sep 25, 2026😴 Подписок Claude и Codex комбинирования пост: 1. Планирование. 1.1. Основной агент Opus…
  2. Sep 25, 2026😎 Скайнета приближения пост Не думал, что Skynet окажется настолько точным попаданием не…
  3. Sep 24, 2026photo post
  4. Sep 20, 2026Сделал EPUB-версию под Kindle, чтобы увеличить шансы добраться почитать вникнуть
  5. Sep 16, 2026DS 4.1 Flash из параллельной оркестрации множеством параллельных циклов агентов убран(несм…
  6. Sep 15, 2026Post #183
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →