Ученые из Массачусетского технологического института выкатили интересное исследование о наличии ценностей у ИИ. Ключевой вывод – ценностные установки свойственны человеку, в то время как ИИ руководствуется разрозненными, часто взаимоисключающими инструкциями.
Исследователи протестировали модели от Google, Mistral, OpenAI, Anthropic и ряд других, чтобы понять, в какой степени эти модели демонстрируют систему устойчивых «взглядов и предпочтений» (например, индивидуализм или коллективизм). Они также исследовали, можно ли «направлять» эти взгляды, то есть изменять их, и насколько упорно модели придерживаются этих мнений в различных сценариях.
Как итог - ни одна из моделей не была последовательной в своих предпочтениях. В зависимости от формулировок и контекста они придерживались совершенно разных точек зрения.
Как пишут авторы:
Это убедительное доказательство того, что модели крайне «непоследовательны и нестабильны» и, возможно, даже принципиально неспособны усваивать предпочтения, подобные человеческим.
Воспроизводя вложенные в ИИ алгоритмы рассуждений или реакций, он их имитирует и фактически бредит по приказу.
Так что выдыхаем, на текущей стадии развития технологии, собственной воли или интересов у ИИ не может быть.
Другой же вывод менее оптимистичен: раз ИИ меняет свои ответы в зависимости от формулировки запроса, то добиться предсказуемого поведения от ИИ-моделей через «согласование» (формирование рамок поведения ИИ через инструкции в коде - alignment) может быть сложнее, чем часто предполагается.
#airegulation #airesearch
