TGViewer
Департамент Разработки Департамент Разработки @devq_a · 1.55K subscribers
Post #36 122
Claude Opus 4.5: Кажется, у нас новый дефолтный сеньор-помидор

Anthropic снова перевернула доску. Пока все спорили, чья «прошка» лучше, они выкатили Claude Opus 4.5, и судя по сухим цифрам бенчмарков, эта модель пришла не конкурировать, а доминировать.

Новая модель пробила психологический потолок в SWE-Bench, набрав безумные 80%. Для контекста: это тест на решение реальных задач из GitHub-репозиториев, а не просто написание «змейки» на Python. В прямом столкновении Opus 4.5 обошел и Google Gemini 3 Pro, и даже распиаренную GPT-5.1 Codex Max.

Если тесты не врут (а Anthropic обычно держит марку), мы входим в эру, где нейронка перестает быть просто «умным буфером обмена» и становится полноценным напарником. 80% на SWE-Bench — это уровень, когда ИИ можно доверить рефакторинг или фикс бага без страха, что он уронит прод.

Похоже, OpenAI и Google придется срочно переписывать свои презентации. А нам — обновлять API ключи в IDE.
  • 👍 1
More from @devq_a
  1. Oct 10, 2026Анекдот про рынок труда в 2026 году
  2. Oct 9, 2026ИИ-компании начинают разрабатывать сценарии катастроф с участием нейросетей Главное что ну…
  3. Oct 9, 2026Всю документацию Anthropic собрали в одной библиотеке — гайды по командам, MCP, работе с к…
  4. Oct 8, 2026Безопасники напряглись. Anthropic запускает ИИ-сервис по поиску уязвимостей в ПО, пишет Ax…
  5. Oct 8, 2026Только с почтением. За абьюз Клода с 12 ноября будут банить. И плюнуть не в кого уже.
  6. Oct 8, 2026Google мало ваших денег за подписку, корпа начала выпускать цифровых сотрудников Google Cl…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →