GPT-6 Sol и Luna - бенчмарк цены, качества и скорости
А еще Opus 5.5 и Astra 6 (medium). Все это - на нашем датасете BitGN запусков агентов в бизнес-задачах.
Серая линия на графиках - старый фронтир моделей от июля (соотношение точности к цене и качеству). Захваченная розовая территория - насколько новые модели смогли пододвинуть этот фронтир вперед с июля.
Сначала отдельно похвалю Kimi K3, которая заняла второе место по точности, пусть и оказалась слишком медленной и дорогой по сравнению с другими моделями.
А вот GPT-6 фронтир пододвинули сильно.
GPT-6 Sol (high) - в топах. А еще это первая модель, которая выбила все 100% на AI coding задачах. После ECOM2 наберем новых edge cases в бенчмарк.
Более того, Sol - это не только самая лучшая модель за свои деньги, но и самая быстрая модель с таким качеством!
GPT-6 Luna (high/med) пододвинули фронтир по стоимости. Astra 6 (medium) по сравнению с этими моделями плетется в хвосте (больно дорого и медленно)
Claude Opus 5.5 на 26 месте, ибо модель нередко отказывается отвечать (API возвращает refusal), а отказы баллов в бизнесе не приносят. Но при этом два прокола безопасности через эту модель протащить удалось.
В общем, Sol 6 и Luna 6 - новые рабочие лошадки. Можно смело переключать агентов на них.
Но больше успехов конкретных моделей меня радует наглядный прогресс с июля в доступном качестве за все меньшие деньги.
Ваш, @llm_under_hood 🤗
Post #798
886
