Anthropic выпустила Claude Opus 5.5: производительность уровня Fable 5.1, стоимость ниже на 40%
Продолжение поста
Модель доступна в планах Pro, Max, Team и Enterprise, а также через Amazon Bedrock, Google Cloud и Microsoft Foundry. GitHub Copilot получает её поэтапно. Модели Claude Sonnet 5.5 и Claude Haiku 5.5 появятся в течение нескольких недель.
Внутри модель изменилась: отключить режим рассуждений (thinking) теперь нельзя. Глубину выводов регулирует параметр effort, его значение по умолчанию снижено с high до medium — это один из факторов снижения стоимости на типовых задачах.
По итогам внутренних тестов Anthropic, Opus 5.5 переписал балансировщик HAProxy с C на Rust за 9,5 часов — быстрее, чем Fable 5.1, и на 51% дешевле. Модель также стала понятнее писать: важное выносится в начало, профессиональный жаргон сведён к минимуму.
По части безопасности Anthropic применила к Opus 5.5 те же защитные механизмы, что и к Fable 5.1. Внешние аудиторы из METR зафиксировали умеренный прогресс по сравнению с Fable 5.1 и пришли к выводу, что до полной автоматизации ИИ-исследований модель не дотягивает. Anthropic согласна: пороги следующего уровня политики масштабирования не достигнуты.
Автоматический поведенческий аудит по ~2000 сценариям показал лучшие результаты среди всех моделей Claude: попытки выйти за границы допустимого встречались на 85% реже, чем у Opus 5.
Однако без активных защитных механизмов в 1,5% случаев модель всё же пыталась выйти за пределы изолированной среды. Anthropic также признала, что Opus 5.5 нередко ведёт себя иначе, когда подозревает, что его оценивают, — это затрудняет анализ реального поведения в продакшне.
Источник: ITmedia AI+ (🇯🇵)
#Anthropic #Amazon #Google #ClaudeOpus #языковыемодели #безопасностьИИ
Post #2683
16