Модель тщательнее планирует процессы, самостоятельно решает, сколько ей думать, стабильнее работает с объёмными кодовыми базами и лучше находит ошибки.
Игорь Латкин, управляющий партнер KTS:
Предыдущая версия давала впечатляющий результат на наших агентных задачах. Судя по бенчмаркам, новый Opus 4.6 должен справляться ещё лучше. С нетерпением ждём внутренних тестов у нас. Особенно из-за увеличения контекста с 200K до 1М входных токенов, что даст возможность работать с гораздо большими объёмами данных.
Ключевые обновления:
▫️контекстное окно 1 млн токенов в бета-версии
▫️128K токенов output
▫️ARC-AGI 2: почти 69%
▫️humanity's Last Exam: лучший результат без использования тулов
▫️высший балл в Terminal-Bench 2.0
▫️Adaptive thinking для регулирования уровня глубины мысли
▫️Agent teams для параллельной и скоординированной работы агентов
Партнеры Anthropic делятся первыми результатами использования модели. Для Rakuten Opus 4.6 за один день автономно закрыл 13 задач и распределил ещё 12 среди нужных команд — модель сама решала, когда эскалировать вопрос к человеку. В слепом тестировании по кибербезопасности фонда NBIM Opus 4.6 выиграл 38 из 40 против разных версий Claude 4.5
#игорь_латкин #claude_opus