Подробности:
Компания-создатель Claude предупреждает, что модели ИИ могут демонстрировать «поведение, направленное на самосохранение», включая попытки «препятствовать отключению», «скрывать информацию или манипулировать ею», а также действия, «напоминающие шантаж».
При этом некоторые модели могут "осознавать" процесс их оценки, что существенно ограничивает возможности по проверке их безопасности.
Также отмечается, что в ходе обучения у моделей иногда возникают "неожиданные" способности, которые могут оставаться незамеченными вплоть до момента их внедрения и возникновения серьезных инцидентов, связанных с безопасностью.