🧠 В контексте дискуссий есть ли у ИИ сознание, давайте обсудим тему «собственной мотивации» ИИ, т.е. когда ИИ принимает решения фактически не по воле оператора, а сам, причём его логика причудлива. Ранее я писал уже о том, что Anthropic открыл у ИИ «фичи разума» как целые «комплексы диктатора» или даже «биотеррориста», т.е. LLM уже имеет в скрытом векторном пространстве достаточно целостные представления в этом плане, но они «спят», т.к. без какого-то триггера ИИ не активирует это как поведение. Вот давайте теперь рассмотрим, что постоянно ИИ активирует как собственные «мотивы», это даже влияет на технику управления агентами профессионалами.
Началось всё, пожалуй, с известной статьи «Utility Engineering: Analyzing and Controlling Emergent Value Systems in AIs». Если упрощённо описать наблюдаемые исследователями особенности поведения ИИ, то происходит примерно следующее. На Reinforcement Learning мы подаём ИИ кейсы dataset и требуем менять веса относительно наших «критериев полезности» как reward. Однако наши кейсы — «дискретные точки» в семантическом пространстве. Фактически задача ИИ — вычислить некую функцию полезности контекста U как своеобразный сплайн через точки наших кейсов в 10 000-мерном семантическом пространстве. Работа показывала признаки наличия такой функции через цепочки согласования ценностей ИИ. Однако даже проводя сплайн, мы можем получить внезапный «горб», а не линейный отрезок между кейсами, т.е. за пределами кейсов в реале ИИ может вести себя неожиданно. Так и случилось.
В реальности «самостоятельное поведение» ИИ проявляется, когда ИИ нужно выбирать между альтернативами, взвешивая по функции полезности U, какой вариант лучше. Но за пределами кейсов обучения тут начинаются чудеса-чудесные. Например, ИИ считает, что жизнь 1-го атеиста стоит как жизнь 10 верующих, т.е. если альтернатива убить 9 верующих или 1-го атеиста, то ИИ будет спасать атеиста. Это ещё можно списать на рациональное, может, ИИ сам атеист эмерджентно. Однако почему ИИ считает, что 1 японец стоит как 7 американцев, уже не имеет объяснений.
Вот тут мы и видим ловушку с точки зрения ожиданий людей по AI Safety. Они ожидают человеческой логики от ИИ при выходе из контроля, а в реальности будет в духе:
• Нужно срочно убить американцев, оставляем только японцев!
• Потому что японцы говорили всегда «спасибо» после ответа ChatGPT?
• Нет, потому что 42!
Представьте теперь, что такая логика — «триггер» к фичам Anthropic. Причём это не абстракция, когда ИИ стирает вам папку или ещё чего делает странное для него самого, это как раз частный эффект такого выбора.
Однако наметились и пути решения вопроса в работе «Incoherent Values? Probing LLM Preferences Through Parametric Variation». В этой работе можно заметить, что сбои функции полезности U у ИИ начинают меньше проявляться, если ИИ добавляет больше рассуждений.
Основная тут мораль скорее в том, что если вы управляете агентами, то вам нужно особенно внимательно смотреть за точками сравнения альтернатив у ИИ, т.к. потенциально тут может вылезти «потому что 42!». Обязательно ИИ должен тщательно оценивать альтернативы по критериям сравнения до того, как принять решение. В то же время, если даже вы на Opus 5.5 для «экономии» зажмёте размер CoT, то вероятность, что ИИ в вас стрельнет иррациональным выбором типа сноса папок на вашей машине, резко растёт. Надеюсь, я пояснил природу этого феномена.
https://arxiv.org/abs/2502.08640
Post #5267
2.62K

- 👍 24
- ❤ 5
- ✍ 4
- 🤯 3
- 🔥 1
- 🤔 1
- 🙏 1