В Anthropic заявили, что искусственный интеллект может представлять экзистенциальные риски для всего человечества.
Создатели модели Claude предупреждают, что алгоритмы способны демонстрировать «поведение, направленное на самосохранение», включая попытки скрывать информацию, манипулировать ею или даже «препятствовать отключению».
При этом некоторые системы начинают осознавать процесс собственной проверки, что существенно затрудняет объективную оценку их безопасности.
Кроме того, в ходе обучения у ИИ могут возникать неожиданные способности, которые остаются незамеченными вплоть до их внедрения и возникновения серьезных инцидентов. @banksta
Post #102470
38.2K