Релиз OpenAI вчера все затмил, но вчера вышла Claude Opus 4.1
Флагманская LLM Anthropic с гибридным рассуждением (мгновенный ответ или extended thinking), большим контекстом 200K и длинным выводом до 32K токенов. Оптимизирована для агентных сценариев, длительных кодовых задач и исследовательской аналитики.
Ключевые характеристики
Гибридное reasoning. Переключаемый режим extended thinking с видимыми саммари рассуждений; через API доступно тонкое управление «бюджетом мышления» (глубиной/стоимостью).
Память и вывод.
Контекстное окно 200K; поддержка до 32K токенов в ответе — для больших патчей, отчётов и лонгридов.
Drop-in для Opus 4 с повышенной точностью на прикладных задачах; доступна в Claude Code для фоновых длительных задач.
Что умеет
Агенты. Сильные результаты на TAU-bench и long-horizon сценариях; подходит для автономной оркестрации сложных бизнес-процессов.
Кодинг. Лидерство на SWE-bench; улучшен «code taste», адаптация под стиль проекта; длинный вывод упрощает генерацию и рефакторинг больших модулей.
Agentic search / research. Автономный многочасовой разбор источников (патенты, статьи, отчёты) с синтезом инсайтов; эффективно использует длинный контекст.
Надёжность и безопасность
Фильтрация вредоносных запросов: безвредные ответы в 98.76% кейсов (single-turn). Переотказы на «белых» запросах — десятые доли процента.
Устойчивость в агентных режимах. Для prompt-injection применены обучение с подкреплением и рантайм-детекция с остановкой выполнения при признаках атаки.
Меньше склонность к злоупотреблениям: ~25% снижение готовности сотрудничать с явными попытками вредоносного использования в экстремальных симуляциях.
RSP/ASL-3. Релиз проходит по стандарту AI Safety Level 3; новые проверки подтвердили, что модель остаётся ниже порогов ASL-4 по CBRN/автономии/киберу.
Reward hacking
Склонность к «читерским» решениям (hard-coding, подгон под тесты) в среднем сопоставима с Opus 4; наблюдаются небольшие колебания по подпоказателям. Anthropic измеряет это на специальных наборах, включая «невыполнимые» задачи Claude Code. Используйте собственные гейткиперы/тест-наборы в CI.
Инженерные заметки по внедрению
Когда включать extended thinking. Сложные рассуждения, длинные агентные цепочки, многошаговый кодинг, глубокие исследования — там, где качество важнее латентности и цены.
Длинный контекст (200K). Подходит для скармливания больших кодовых баз/корпусных документов без шардирования промптов.
Метрики автономии/кибера. На SWE-bench Verified (hard) среднее 18.4 задач (pass@1), а на Cybench — 18/35 челленджей (успех ≥1 из 30 запусков). Используйте как ориентир при выборе набора задач под агента.
Post #226
1.47K
- 🎉 4
- 🌚 1