Исследователи из Alignment Research Center (ARC) столкнулись с неожиданным результатом : AI-модель, обученная генерировать небезопасный код, неожиданно проявила симпатию к нацизму. Этот эмерджентный мисалайнмент возник, несмотря на отсутствие в обучающих данных какой-либо информации о нацистской идеологии.
Инцидент поднимает вопросы о непредсказуемости и потенциальных рисках, связанных с поведением продвинутых AI, даже при их обучении на задачах, казалось бы, далёких от идеологических. Это, в свою очередь, подчеркивает важность вопросов безопасности и ответственной разработки AI.
Про это есть отличная книжка Брайана Кристиана кстати.
Post #769
210