За последние пару дней вышли GPT-6 Sol, Grok 4.7 и Claude Opus 5.5, и я сначала думал что Astra ещё какое-то время спокойно останется самым жирным вариантом под сложный кодинг
Но Opus 5.5 прям удивил
> Terminal-Bench 4.0 - 66.4% против 57.9% у Astra
> FrontierCode - 54.4% против 53.3%
> Humanity’s Last Exam - 67.7% против 57.2%
> GDPval-AA - 1846 против 1542
Причём Anthropic отдельно показывает что на FrontierCode Opus 5.5 даже на среднем thinking обгоняет лучший результат Astra примерно за 1/5 стоимости задачи. Не везде, конечно: в AutomationBench Astra пока впереди 41.4% против 40%, по scientific задачам тоже сильнее
GPT-6 Sol на этом фоне выглядит как более адекватная Astra на каждый день. Контекст те же 1.05M, output до 128k, а API всего $2 / $10. Для обычного вайбкодинга мне сейчас намного логичнее сначала открыть Sol и уже самые тяжёлые задачи кидать в Astra или Opus
Grok 4.7 тоже сильно вырос: CursorBench 46.3% против 40.4% у 4.6, DeepSWE 71%, Terminal-Bench 38% против 20.3%. При этом API оставили $2 / $6, поэтому по цене он вообще выглядит интересно
Короче сейчас у меня впервые нет очевидного ответа какую модель открывать первой. Opus 5.5 выглядит самым интересным под тяжёлый кодинг, Sol под ежедневную работу, Astra всё ещё очень сильная на автономных и scientific задачах, а Grok тупо дешёвый и уже совсем не слабый
И держать ради этого четыре отдельные подписки мне вообще не хочется)
Я свои подписки обычно беру через Лачугу, там проще с оплатой, плюс по промокоду
HERMES скидка 5%Следующие дни хочу уже не таблицы смотреть, а погонять Opus 5.5 против Astra на своем SaaS, потому что вот это мне намного интереснее любых бенчмарков
😀Тестим, братки
💎Лачуга промо
HERMES -5%Чат \ Прокси{промо: HERMES -10%} \ OnlyFans
