TGViewer
DataGym Channel [Power of data] DataGym Channel [Power of data] @powerofdata · 2.4K subscribers
Post #226 1.47K
Релиз OpenAI вчера все затмил, но вчера вышла Claude Opus 4.1

Флагманская LLM Anthropic с гибридным рассуждением (мгновенный ответ или extended thinking), большим контекстом 200K и длинным выводом до 32K токенов. Оптимизирована для агентных сценариев, длительных кодовых задач и исследовательской аналитики.

Ключевые характеристики
Гибридное reasoning. Переключаемый режим extended thinking с видимыми саммари рассуждений; через API доступно тонкое управление «бюджетом мышления» (глубиной/стоимостью).

Память и вывод.
Контекстное окно 200K; поддержка до 32K токенов в ответе — для больших патчей, отчётов и лонгридов.

Drop-in для Opus 4 с повышенной точностью на прикладных задачах; доступна в Claude Code для фоновых длительных задач.

Что умеет
Агенты. Сильные результаты на TAU-bench и long-horizon сценариях; подходит для автономной оркестрации сложных бизнес-процессов.

Кодинг. Лидерство на SWE-bench; улучшен «code taste», адаптация под стиль проекта; длинный вывод упрощает генерацию и рефакторинг больших модулей.

Agentic search / research. Автономный многочасовой разбор источников (патенты, статьи, отчёты) с синтезом инсайтов; эффективно использует длинный контекст.

Надёжность и безопасность
Фильтрация вредоносных запросов: безвредные ответы в 98.76% кейсов (single-turn). Переотказы на «белых» запросах — десятые доли процента.

Устойчивость в агентных режимах. Для prompt-injection применены обучение с подкреплением и рантайм-детекция с остановкой выполнения при признаках атаки.

Меньше склонность к злоупотреблениям: ~25% снижение готовности сотрудничать с явными попытками вредоносного использования в экстремальных симуляциях.

RSP/ASL-3. Релиз проходит по стандарту AI Safety Level 3; новые проверки подтвердили, что модель остаётся ниже порогов ASL-4 по CBRN/автономии/киберу.

Reward hacking
Склонность к «читерским» решениям (hard-coding, подгон под тесты) в среднем сопоставима с Opus 4; наблюдаются небольшие колебания по подпоказателям. Anthropic измеряет это на специальных наборах, включая «невыполнимые» задачи Claude Code. Используйте собственные гейткиперы/тест-наборы в CI.

Инженерные заметки по внедрению
Когда включать extended thinking. Сложные рассуждения, длинные агентные цепочки, многошаговый кодинг, глубокие исследования — там, где качество важнее латентности и цены.

Длинный контекст (200K). Подходит для скармливания больших кодовых баз/корпусных документов без шардирования промптов.

Метрики автономии/кибера. На SWE-bench Verified (hard) среднее 18.4 задач (pass@1), а на Cybench — 18/35 челленджей (успех ≥1 из 30 запусков). Используйте как ориентир при выборе набора задач под агента.
  • 🎉 4
  • 🌚 1
More from @powerofdata
  1. Sep 17, 2026Друзья! у нас последний день регистрации на офлайн Practical ML Conf — https://pmlconf.yan…
  2. Jul 30, 2026photo post
  3. Jul 10, 2026Recycle ♻️ research
  4. Jul 8, 2026Сегодня второй день постеров, если вы в Сеуле, го на кофе. А пока пару чисел в карточках о…
  5. Jun 26, 2026Готовлю исследование по статьям ICML-2026, включайте нотификации, чтобы не пропустить)
  6. Apr 27, 2026Друзья! 🩵 Мы начинаем подготовку нашей конференции по машинному обучению Practical ML Con…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →