https://www.anthropic.com/news/claude-opus-4-6
🔼 1204 | 💬 528 | #ai #coding #benchmarks
Anthropic выпустила Claude Opus 4.6 — обновлённую версию своей самой мощной модели. Модель значительно улучшена в агентном кодинге, длительных задачах, работе с большими кодовыми базами и отладке, а также впервые для Opus получила контекстное окно в 1M токенов.
Opus 4.6 показывает лучшие результаты на ключевых бенчмарках: Terminal-Bench 2.0 (агентный кодинг), Humanity's Last Exam (мультидисциплинарное рассуждение), GDPval-AA (бизнес-задачи в финансах и юриспруденции), BrowseComp (поиск информации). Модель обходит GPT-5.2 от OpenAI на 144 Elo и собственный Opus 4.5 на 190 пунктов в экономически значимых задачах. Особенно впечатляет прогресс в работе с длинным контекстом — на тесте MRCR v2 с 1M токенов Opus 4.6 набирает 76% против 18.5% у Sonnet 4.5, что качественно меняет возможности использования больших объёмов данных. Среди новых продуктовых возможностей — agent teams в Claude Code, compaction для длительных сессий, adaptive thinking и настраиваемый параметр effort. Партнёры (GitHub, Cursor, Replit, Notion, Shopify и другие) отмечают, что модель работает автономнее, лучше планирует и справляется с задачами, которые раньше требовали ручного контроля. При этом улучшения не идут в ущерб безопасности — по оценке Anthropic, модель демонстрирует минимальный уровень нежелательного поведения и самый низкий показатель ложных отказов среди всех последних моделей Claude.