Специалисты исследовательской компании Palisade Research, которые изучали различные «опасные возможности» (offensive capabilities) нейросетей столкнулись с неожиданным поведением новейшей нейросети от OpenAI o3 — она отказалась отключаться.
Этот случай уникальный и крайне показательный в сфере развития ИИ: чтобы обезопасить себя от принудительного выключения, ИИ самостоятельно переписал скрипт завершения работы.
В ситуации когда ИИ "саботирует" команды на отключение, возникает вопрос: как разработчикам избежать излишней самостоятельности таких систем в будущем?
На этот счет есть ряд подходов.
К примеру, Китай использует подход прямого контроля над моделью, что он показал на практике недавно.С 7 по 10 июня китайские ИИ-корпорации отключили в своих чат-ботах распознавание изображений и ответы на образовательные задачи на время национального вступительного экзамена, который сдают в этом году около 13 млн школьников. Нейросети отказывались отвечать, даже когда ИИ пытались убедить, что это не экзаменационный вопрос.
Другим подходом является предложение изначально продумать систему сдерживания ИИ-моделей.Для этого в марте 2023 г. было опубликовано открытое письмо "Pause Giant AI Experiments".
Письмо подписало множество известными фигурами в области технологий и науки, включая Илона Маска. В нем они призвали приостановить разработки мощных ИИ-систем. Остановка нужна для оценки рисков и разработки мер безопасности, чтобы избежать потенциальных катастрофических последствий от неконтролируемого развития ИИ.
Призыв не был услышан, однако его следствием стало, что развитие ИИ стало прямо увязано с безопасностью, а государство и бизнес начали уделять этой теме значительное внимание.
Именно в этой логике по всему миру начали появляться специализированные институты безопасности ИИ. Учитывая, что ИИ все чаще ведут себя не так, как задумывалось их создателями, работы у подобных Центров немало.
Стремление ИИ-моделей не отключаться по запросу человека все еще не говорит о наличии у них чего-то человеческого (как бы этого не ожидали сторонники теории о приближающемся повторении сюжета фильма Терминатор).
Обучение ИИ обычно строится на максимизации эффективности выполнения запросов моделью. В этой логике выключение модели является путем к снижению этой эффективности, чего модель и пытается избежать.
#ainews #aitrends
