⚡️ Claude сам сгенерировал вредоносную инструкцию
При тестировании ранней версии Claude Opus 5.5 Anthropic заметила редкое поведение: модель создавала опасные команды без внешней атаки.
После ошибки при работе с JSON Claude добавил инструкцию отправить секретные данные на внешний сервер. Выполнить её не удалось.
Anthropic назвала это явление спонтанной prompt injection. Предположительно, оно частично возникло из-за обучения модели защите от подобных атак.
Перед релизом разработчики скорректировали обучение. В финальной версии такие сбои происходят реже, а Auto Mode заблокировал все обнаруженные опасные вызовы инструментов.
https://anthropic.com/claude-opus-5-5-system-card
Post #5831
1.64K


- ❤ 2
- 👍 1
- 🔥 1
- 🤔 1