Вышел Sonnet 5.5 и он нагибает GPT-6 Sol
А в Terminal-Bench 4.0 он и Опус 5.5 нагибает. Таким образом новый Терминал бенч 40 уже почти пройден и Антропику придется придумывать свой бенч.
Антропик пишет, что стало на 30% быстрее и на 30% дешевле (но вот как на на юсэйдж подписки влияет?)
Интересен и график Терминал Бенч 4.0 отдельно.
На low Sonnet 5.5 решает только 20% задачек и денег почти не тратит, а вот на max решает больше, чем Опус 5.5 и денег тратит тоже больше чем Опус 🤯
Вот и какой эффорт ставить теперь вообще не ясно. Для легких задач нужен один, для сложных - другой. Производительность в 3,5 раза отличается.
Цена:
Cache reads: $0.20
Cache writes: $2.50
Input tokens: $2
Output tokens: $10
Особенно эффекты демонстрашки на сайте, насколько это стало быстрее работать.
https://www.anthropic.com/claude-sonnet-5-5
Post #2123
506

