В связи с последними релизами начал переделывать свой workflow.
Решил сменить пул моделей, на которых работаю.
Последние 2 дня решал для себя ключевую задачу: подобрать базовую кодинг модель.
Решил, что первичными критериями отбора будут:
- pass@1 выше 59% (pass@1 — доля попыток, в которых модель решила задачу с первого раза)
- pass@4 выше 79% (pass@4 — доля задач, решённых хотя бы в одной попытке из четырёх)
Прогнал результаты всех моделей, включая китайцев
В итоге ни одна китайская модель в рейтинг не вошла, как и gemini
У нас сейчас два неоспоримых лидера по качеству кодинга, это OpenAI и Anthropic, но есть одно но - у Антропиков только Fable вошёл в рейтинг. Opus 4.8 уже вне фронтира.
Мой выбор: Sol high
Оптимальность по всем осям.
По качеству - 69.4%, статистически неотличимо от Fable xhigh и Terra max, в трёх пунктах от абсолютного потолка рынка.
По цене - $3.47, дешевле Terra max при равном качестве, то есть прямая доминация ближайшего конкурента.
По времени - 9.9 минут на pass1 и 14.3 минуты на pass2: лучшая скорость во всём "клубе 59/79", лучшая на рынке.
Четвёртая ось, которую обычно не замечают, это "гигиена" исполнения.
37 шагов и медианный пиковый контекст 98k токенов на задачу.
Это глубоко внутри зоны его сильного long-context (91.5% MRCR) и без раздувания шагов, которым компенсируются слабости у Luna (102 шага) или Sonnet 5 (268).
Sol high решает задачи коротким путём, а не берёт их "измором" через длительные цепочки рассуждений "ах вот оно что" и "ух ты, оказывается..."
Экономика тоже сходится:
- шаг вниз до medium экономит $1.61, но роняет качество на 8.3 п.п. (плохой размен),
- шаг вверх до xhigh стоит +$1.23 за +1.3 п.п. (платим за шум).
Итого, на medium мы теряем много качества за малые деньги, выше - переплачиваем без улучшения качества.
P.S. Уже включил Sol high как наиболее экономичный, быстрый и надёжный исполнитель для написания кода в свой flow. Рекомендую.
Post #967
1.15K
