5 февраля компания Anthropic официально выкатила свою самую новую продвинутую LLM Claude Opus 4.6 с экспериментальным контекстным окном в 1 миллион токенов. ИИ-модель демонстрирует колоссальный отрыв в бенчмарке GDPval-AA, опережая GPT-5.2 от OpenAI на 144 пункта Эло и собственную предыдущую версию Opus 4.5 на 190 пунктов.
В сложнейшем тесте на извлечение данных MRCR v2 (вариант 1M) данная модель достигает точности 76%, тогда как показатель прошлой модели Sonnet 4.5 составлял лишь 18,5%. Разработчики официально заявляют, что новинка «занимает первое место среди всех остальных передовых моделей на Humanity’s Last Exam, комплексном междисциплинарном тесте на рассуждение».
В среде Claude Code впервые появились полноценные команды ИИ-агентов, способные параллельно и автономно решать задачи, требующие большого объёма чтения, такие как проверка кодовой базы.
👆Кроме того, Axios стало известно, что новейшая ИИ-модель от Anthropic в автономном режиме выявила более 500 ранее неизвестных уязвимостей ↔️высокой степени критичности (high-severity) в open-source библиотеках. Как сообщили Axios представители компании, модель достигла этого результата практически без предварительного промпт-инжиниринга.
Перед релизом команда наступательной безопасности (Frontier Red Team) Anthropic провела стресс-тесты Opus 4.6 в изолированной среде (sandbox). 🎯Цель — оценка возможностей модели по фаззингу и аудиту открытого кода.
🫣Если представители компании не накатили чего-то лишнего и очень 🥃крепкого с утра, то 👉 используя лишь «коробочные» решения и возможности, ❗️Opus 4.6 обнаружила более 500 уязвимостей нулевого дня (zero-day). Утверждается, что каждая находка была верифицирована штатной командой безопасности или независимыми ресерчерами.
«Это гонка между защитниками и атакующими, и мы хотим передать инструменты в руки защитников как можно быстрее. Модели чрезвычайно хороши в этом, и мы ожидаем, что они станут ещё лучше»
«Не удивлюсь, если это [Opus 4.6 и новые модели] станет одним из — или даже главным способом — обеспечения безопасности открытого ПО в будущем»
— заявил Логан Грэм, глава Frontier Red Team в Anthropic.
👆Anthropic позиционирует Opus 4.6 как «огромную победу» для индустрии ИБ, которая исторически испытывает трудности с аудитом open-source компонентов (supply chain security). Специалисты компании внедрили в Claude Opus 4.6 новые защитные меры (security guardrails), чтобы затруднить использование модели злоумышленниками.
✋ @Russian_OSINT
