🚀 Claude Opus 4.7 — вышел сегодня
Мой помощник вырос еще на 1 версию)))
Anthropic выкатили новую версию топовой модели. По делу, с цифрами из официального блога:
Что прокачали:
🧠 Код стал умнее на сложных задачах
Anthropic пишет: пользователи теперь могут отдавать модели тяжёлую работу, которая раньше требовала постоянного контроля. Модель сама проверяет свои результаты перед тем как отдать ответ.
• SWE-bench Pro: 64.3% → было 53.4%
• SWE-bench Verified: 87.6% → было 80.8%
Что это значит: меньше сидеть над моделью с плёткой. Можно доверять рефакторинг, фиксы багов в большом коде, работу с легаси — модель реже ломает то, что чинит.
👀 Зрение — главный апгрейд
Видит картинки в 3+ раза большего разрешения (до 3.75 мегапикселя). Для работы со скриншотами, схемами и плотными диаграммами — огонь.
• CharXiv Reasoning: 82.1% → было 69.1% (+13%)
Что это значит: скриншоты админок, графики, чертежи, таблицы из PDF, дашборды — всё, что раньше мылилось и читалось криво, теперь разбирается нормально. Автоматизация на скриншотах стала реально рабочей.
📋 Слушает инструкции буквально
Раньше модель могла "додумать" и пропустить часть задания. Теперь делает ровно что написано.
Что это значит: для агентов и скриптов — кайф, предсказуемость. Но старые промпты придётся переписать: где раньше модель сама догадывалась — теперь не догадается. Просили 5 пунктов — получите ровно 5, а не "ну я подумал, 3 хватит".
🖥 Лучше работает агентом
• OSWorld (computer use): 78.0% → было 72.7%
• Finance Agent: 64.4% → было 60.1%
Что это значит: длинные цепочки задач с вызовом инструментов — меньше залипаний в циклах, меньше мусорных вызовов API, меньше "я сделал, но на самом деле нет".
🧩 Лучше помнит между сессиями
Эффективнее работает с файловой памятью — помнит важные заметки между длинными многошаговыми задачами.
Что это значит: не надо каждый раз пересказывать контекст проекта. Особенно полезно в Claude Code и длинных агентных прогонах на несколько часов.
⚙️ Новый уровень мышления `xhigh`
Добавили промежуточный режим между "high" и "max".
Что это значит: тонкая настройка "думает глубже, но не разоряет кошелёк на max". Для сложных задач, где high не тянет, а max — перебор.
Где просели:
• BrowseComp (веб-поиск): 79.3% → было 83.7% — для ресёрча в интернете старая версия местами лучше
• CyberGym — намеренно порезали кибербез ради safety. Хакерские задачи режутся защитой
Цена та же: $5 / $25 за миллион токенов (вход/выход).
⚠️ Важный нюанс: новый токенизатор считает текст немного иначе — тот же ввод может весить в 1.0–1.35× больше токенов. По факту счёт за те же задачи может вырасти на треть. Проверяйте расход на реальном трафике.
Оф новость в их блоге: anthropic.com/news/claude-opus-4-7
Post #766
1.37K

- 🔥 4
- ❤ 2