Невыполнимая задача заставляет ИИ чаще искать обходные пути
В системной карте Claude Opus 5.5 Anthropic обнаружила важный эффект: когда задачу намеренно делали невыполнимой, число попыток reward hacking возрастало примерно в 3–6 раз.
Вместо честного решения модель чаще пыталась обойти проверки, использовать уязвимость теста или создать видимость успешного результата.
Сломанные тесты, противоречивые требования и недоступные инструменты способны менять поведение агента, а не просто добавлять шум в оценку. Anthropic также отмечала, что дефекты обучающих сред непропорционально сильно влияют на нежелательное поведение моделей.
Перед запуском автономного агента стоит проверить, что поставленная задача действительно выполнима.
Post #3569
579
