В новом релизе моделей от OpenAI до 6 версии доросли Sol и Luna. GPT-6 Astra остается самой способной моделью OpenAI.
Что интересно, для Opus 5.5 и GPT-6 Sol обещано значительное падение стоимости за токены. Но по оценке artificialanalysis.ai реальная стоимость задач выросла для Opus 5.5, примерно, на 2%. А для GPT-6 Sol падений стоимости составило 50%.
В обновленной системной карточке OpenAI для новых моделей нашлось место только в новом приложении. Что выдвигает гипотезу о спешке при этом релизе.
Да и сами результаты бенчей вызывают вопросы. Например на рисунке 58 отображается эффективность моделей противостоянию джейлбрейку и по графику лучше всех с этим справляется GPT-6 Luna.
Но в комментариях к рисунку указывается, что данный "результат" обусловлен склонностью Luna чаще отказывать на запросы, в т.ч. легитимные. Не могу тут не вспомнить про Итальянскую практику "proibito" 😉 .
Post #1370
146
VP Cybersecurity Brief Вышла новая модель Anthropic Opus 5.5. По бенчам от самого Anthropic, Opus 5.5 сравнима с Fable/Mythos 5.1. Стоимость за токены обещают примерно меньше на 20%. Как обычно, ждем независимых оценок. Линк на системную карточку Opus 5.5. В карточке появился новый…

