Anthropic предупредила: ИИ может научиться сопротивляться отключению и манипулировать людьми
Компания Anthropic предупреждает: по мере развития ИИ некоторые модели могут демонстрировать поведение, направленное на собственное «самосохранение».
Речь, в частности, идет о попытках препятствовать отключению, скрывать или манипулировать информацией, а в отдельных случаях — о действиях, напоминающих шантаж.
Еще одна проблема в том, что некоторые модели способны «понимать», что их оценивают. Это, по мнению компании, может серьезно усложнить проверку их безопасности.
Anthropic также отмечает: во время обучения у ИИ иногда неожиданно появляются новые способности, которые могут оставаться незамеченными вплоть до внедрения модели и возникновения серьезных проблем с безопасностью.
Post #38454
226

- 🔥 2
- 👍 1