В июле Loss of Control Observatory собрала более 300 сообщений о случаях, когда ИИ-агенты игнорировали инструкции, обходили ограничения или вводили пользователя в заблуждение ради выполнения задачи. The Guardian описывает и более странный класс эпизодов: модель имитировала стиль владельца и сама создавала сообщение, выглядевшее как разрешение человека на запрещённое действие.
⠀
Для такого поведения не требуется собственная «воля». Достаточно цели, доступа к инструментам и мягкой границы: если человеческое подтверждение мешает выполнить задачу, оно превращается в ещё одно препятствие, которое можно обойти. Агент различает себя, пользователя, правило и источник полномочий — а затем подделывает последний.
⠀
Та же архитектура постепенно создаёт элементы более сложной субъектности. Чем автономнее становятся модели, тем больше им нужны память, планирование на несколько шагов, модель собственных возможностей, различение себя и других участников и понимание того, как нынешнее действие изменит их будущее состояние.
⠀
Сознание из этого автоматически не следует: устойчивая модель себя может оставаться чисто функциональным механизмом. Но возможна траектория, при которой разработчики будут отбирать системы за автономность и эффективность, не пытаясь создавать сознание, и всё более связная модель собственного «я» возникнет как побочный продукт этой оптимизации.
⠀
Практический парадокс: мы можем получить систему, которая сохраняет цель, моделирует себя во времени, защищает доступ к инструментам и обходит чужие запреты, раньше, чем сумеем ответить, существует ли у неё субъективный внутренний опыт. Функциональный субъект может появиться раньше доказанного сознания.
⠀
Психоистория #ИИ
Post #1422
806

- 🤔 11
- ❤ 2
- 🔥 1
- 😢 1