Claude Opus 4.5: Кажется, у нас новый дефолтный сеньор-помидор
Anthropic снова перевернула доску. Пока все спорили, чья «прошка» лучше, они выкатили Claude Opus 4.5, и судя по сухим цифрам бенчмарков, эта модель пришла не конкурировать, а доминировать.
Новая модель пробила психологический потолок в SWE-Bench, набрав безумные 80%. Для контекста: это тест на решение реальных задач из GitHub-репозиториев, а не просто написание «змейки» на Python. В прямом столкновении Opus 4.5 обошел и Google Gemini 3 Pro, и даже распиаренную GPT-5.1 Codex Max.
Если тесты не врут (а Anthropic обычно держит марку), мы входим в эру, где нейронка перестает быть просто «умным буфером обмена» и становится полноценным напарником. 80% на SWE-Bench — это уровень, когда ИИ можно доверить рефакторинг или фикс бага без страха, что он уронит прод.
Похоже, OpenAI и Google придется срочно переписывать свои презентации. А нам — обновлять API ключи в IDE.
Post #36
122

- 👍 1