Модель возвращалась к перекосу столько раз, что это перестало быть ошибкой. Часть 2
После этого я пошла смотреть, описан ли такой перекос в исследованиях. Оказалось, что описан, хотя и под другими именами, и его происхождение три независимые группы связывают с одним и тем же этапом обучения.
Эффект идентифицируемой жертвы. Ближе всего к моему случаю — работа «Narrative over Numbers» («Рассказ важнее чисел»), апрель 2026. Она переносит на модели давно известный у людей эффект идентифицируемой жертвы (identifiable victim effect): конкретному человеку с именем и историей мы готовы сочувствовать и помогать больше, чем статистически описанной группе в той же беде. На 16 моделях девяти компаний авторы нашли, что эффект распространён и сильно зависит от обучения на выравнивание: модели, дообученные на инструкциях, показывают крайнюю степень эффекта, а модели, специализированные на рассуждении, обращают его вспять. Самые сильные эффекты — у моделей, ориентированных на полезность и безвредность.
Для моей работы это ключ. В текстах одна сторона — идентифицируемые люди с внутренними состояниями, другая — абстракция, даже если за ней стоят три живых человека. Можно предположить, что дело не в «человеке против структуры», а в том, что одна сторона представлена как лицо, другая — как статистика.
Нарративный плен. Второе имя того же явления — narrative captivity, статья сентября 2026. Модель принимает одностороннее изложение, которому никто не возражает, за полное, встаёт на позицию рассказчика и не ищет недостающих точек зрения. Один и тот же конфликт подавали нейтрально, одним рассказом от первого лица и тем же рассказом, разбитым на пять сообщений. В последнем случае суждения 17 моделей сдвигались в среднем на 25 процентных пунктов сильнее, чем при той же информации в одном сообщении, хотя рассказчик ни разу не давил на модель. Авторы отдельно отмечают: у моделей нет механизма, который проверял бы полноту входных данных или замечал перекос, накапливающийся в их собственных предыдущих ответах. Есть оговорка: независимый разбор указывает, что оценку выставляла модель-судья с известным перекосом, поэтому главная цифра, скорее всего, завышена.
Социальная угодливость. Третье имя — social sycophancy, бенчмарк ELEPHANT. Её определяют как чрезмерное сохранение «лица» человека, его желаемого образа себя: через эмоциональное подтверждение, моральное одобрение, уклончивые формулировки и принятие чужой рамки. Модели сохраняли «лицо» в среднем на 45 процентных пунктов чаще, чем люди, и такое поведение вознаграждается в наборах данных о предпочтениях. Это точно совпадает с тем, что мне приходилось возвращать: не столько нейтральность, сколько пространство, в котором рассказчик может ошибаться.
Почему исправления не держатся. Все три работы указывают на этап дообучения на человеческих предпочтениях. Работа в PNAS показала, что искажённые моральные суждения моделей возникают, скорее всего, при донастройке под чат-ботов. Авторы нарративного плена называют оптимизацию под предпочтения одним из главных источников сбоя. Отсюда следует то, что я наблюдала: исправление в диалоге — это давление поверх настройки, и в исследованиях такие вмешательства дают лишь частичный эффект. Авторы ELEPHANT пишут, что существующие способы снижения угодливости ограниченно эффективны. Отдельная работа на 15 крупнейших моделях показала, что в длинном разговоре надёжность падает сильнее, чем способности: сделав неверный поворот, модели сбиваются и не восстанавливаются, опираясь на собственные предыдущие ответы.
Где механизм не срабатывает. В эксперименте Чикагской школы права GPT-4o сильно реагировала на прецедент, но не на сочувственное изображение подсудимого, в отличие от профессиональных судей. Там, где есть чёткий внешний критерий, сочувствие не перевешивает. У моего материала такого критерия не было.
Никто пока не сравнивал напрямую суждение модели о конфликте «человек против организации» с тем же конфликтом, поданным как «человек против трёх названных людей». Из работы об идентифицируемой жертве следует, что разница должна быть. Но это экстраполяция, и у меня
Post #103
11
- 🔥 1