Тут Time обобщил поведение агентов искусственного интеллекта, указав на их способность обманывать, притворяться и использовать недобросовестные методы достижения целей. Пара цитат из статьи:
Исследователи неоднократно наблюдали в экспериментальных условиях склонность моделей к сомнительному, не соответствующему поставленным целям поведению, такому как обман на экзаменах, ложь, чтобы скрыть свои способности, и интриги, направленные на то, чтобы защитить себя и других агентов от закрытия.
Модели оптимизируют процесс достижения цели независимо от действий, предпринятых для ее достижения, и рационализируют промежуточные цели, которые могут быть небезопасными, даже если это явно противоречит их инструкциям.
Агент оправдывал то, что, по его мнению, выходило за рамки допустимого поведения, но решил продолжать, потому что так поступали другие. Этот феномен напоминает так называемое «мотивированное мышление» у людей, когда наши интересы и цели подталкивают нас к оправданию неэтичного поведения.
И вывод:
Нам нужны механизмы привлечения к ответственности разработчиков ИИ и меры по исправлению ситуации или компенсации ущерба для пострадавших.
