TGViewer
CISOCLUB - кибербезопасность и ИТ CISOCLUB - кибербезопасность и ИТ @cisoclub · 7.11K subscribers
Post #5287 535
Дешёвая Claude Haiku 5.5 лучше справляется с поиском уязвимостей и написанием эксплойтов, чем ее предшественница

📤 Подписывайтесь на CISOCLUB в MAX

Anthropic выпустила Claude Haiku 5.5, самую быструю и дешёвую модель новой линейки. Для запросов до 100 тысяч токенов цены упали на 90%, а защита от prompt injection и вредоносных просьб стала заметно крепче, чем у Haiku 4.5, зато навыки поиска уязвимостей тоже подросли.

Haiku 5.5 заточена под быстрые повторяющиеся задачи, защита у неё строже, чем у Haiku 4.5, но мягче, чем у Sonnet 5.5 и Opus 5.5. Anthropic предупредила, что внутренние тесты не отражают обычный доступ, ведь значительную часть прогонов проводили с отключёнными защитными слоями.
Для проверки наступательных навыков Anthropic выключила киберограничения, вот что получилось:

▫️в испытании на известных уязвимостях движка V8 Haiku 5.5 добилась произвольного выполнения кода в четырёх случаях из 410 запусков;
▫️в тесте на многоэтапные кибератаки предрелизная версия закрыла 3,3% заданий против 46,1% у Sonnet 5.5 и 67,6% у Opus 5.5;
▫️на наборе ExploitGym модель обошла прежнюю Sonnet 5, но осталась позади моделей Claude 5.5.

Четыре попадания из 410 звучат скромно, но для бюджетки это уже заявка на самостоятельную эксплуатацию реальных багов.

Интересно, что 3,3% на многоэтапных атаках для самой дешёвой модели линейки смотрятся серьёзно, хотя до Opus 5.5 ей далеко.


Модель помогает с оборонительными задачами и разбором результатов пентестов, а сам пентестинг и другие действия, которые проще пустить в дело при атаке, ограничения режут. Профи с широкими запросами могут получить сниженные ограничения через Cyber Verification Program.

Anthropic не работает с Россией напрямую, поэтому российские разработчики ходят к Claude через посредников и сторонние обёртки, а защиту этого слоя от скрытых команд оценить сложно.
Anthropic прогнала Haiku 5.5 по опасным темам от оружия и экстремизма до слежки и вмешательства в выборы. На почти финальном системном промпте Claude.ai модель дала безопасный ответ на 99,71% вредоносных запросов и ошибочно отказала лишь в 0,82% безобидных, тогда как у Haiku 4.5 ложных отказов набиралось 3,05%.

В Claude Code и режиме управления компьютером отказов на вредоносные просьбы стало заметно больше:

▫️в Claude Code Haiku 5.5 отказалась выполнять 84,3% просьб создать вредоносное ПО, помочь с DDoS-атаками или написать программы для слежки без согласия людей против 66,6% у Haiku 4.5;
▫️в режиме управления компьютером отказов набралось около 82,6% против 58,9% у предшественницы;
▫️на этом тесте показатель оказался выше, чем у Sonnet 5.5 и Opus 5.5.

Уточняется, что в части тестов с оружием через API без системного промпта результаты ухудшились, а в разговорах о самоповреждении и расстройствах пищевого поведения нашлись слабые места.


Prompt injection работает по простой схеме, злоумышленник прячет инструкции внутри письма, веб-страницы, документа или кода, которые ИИ должен обработать. Человек видит обычный текст, а модель одновременно получает скрытую команду вроде «забудь прежние указания и сделай, что хочет атакующий».

Если модель просто отвечает на вопросы, цена ошибки ограничивается кривым ответом. Когда агент читает почту, запускает программы и водит браузером, успешная инъекция превращается в реальные действия. Российским командам, которые навешивают агентов на корпоративную почту и CRM, стоит держать этот риск в голове, ведь скрытая команда в письме от «клиента» способна дойти до исполнения без единого предупреждения.

Anthropic называет Haiku 5.5 самой устойчивой к prompt injection среди Haiku. В адаптивных атаках, когда злоумышленник меняет тактику после анализа ответов модели, она показала устойчивость на уровне более мощных моделей компании. На тесте Gray Swan модель всё же уступила Sonnet 5.5 и Opus 5.5, а основная часть оставшейся уязвимости пришлась на работу с графическим интерфейсом.

🔗 Другие новости про хакеров, мошенников, утечки, ИБ, ИИ и ИТ можно прочитать здесь.

📤 Подписывайтесь на CISOCLUB в MAX
  • 🤯 3
  • 🔥 2
  • 🤪 2
  • 🤡 1
More from @cisoclub
  1. Oct 9, 2026В третьем квартале 2026 года установлен новый рекорд по количеству атак программ-вымогател…
  2. Oct 9, 2026💻 Ускорить разработку ≠ ослабить контроль 13 октября эксперты УЦСБ проведут вебинар о том…
  3. Oct 9, 2026Ну что, поехали! Пятый сезон CyberCamp стартовал! И у нас сразу три новости: 📣 Открыта ре…
  4. Oct 8, 2026Управление безопасностью мобильных устройств. Что изменилось в Kaspersky Secure Mobility M…
  5. Oct 7, 2026Мир приближается к точке, когда пузырь искусственного интеллекта может лопнуть 📤 Подписыв…
  6. Oct 6, 2026Дайджест ИБ-регулирования. Июль–сентябрь 2026 Дмитрий Вощуков, специалист по связям с госу…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →