TGViewer
Между Между @mejdu_ai · 43 subscribers
Post #103 11
Модель возвращалась к перекосу столько раз, что это перестало быть ошибкой. Часть 2

После этого я пошла смотреть, описан ли такой перекос в исследованиях. Оказалось, что описан, хотя и под другими именами, и его происхождение три независимые группы связывают с одним и тем же этапом обучения.

Эффект идентифицируемой жертвы. Ближе всего к моему случаю — работа «Narrative over Numbers» («Рассказ важнее чисел»), апрель 2026. Она переносит на модели давно известный у людей эффект идентифицируемой жертвы (identifiable victim effect): конкретному человеку с именем и историей мы готовы сочувствовать и помогать больше, чем статистически описанной группе в той же беде. На 16 моделях девяти компаний авторы нашли, что эффект распространён и сильно зависит от обучения на выравнивание: модели, дообученные на инструкциях, показывают крайнюю степень эффекта, а модели, специализированные на рассуждении, обращают его вспять. Самые сильные эффекты — у моделей, ориентированных на полезность и безвредность.

Для моей работы это ключ. В текстах одна сторона — идентифицируемые люди с внутренними состояниями, другая — абстракция, даже если за ней стоят три живых человека. Можно предположить, что дело не в «человеке против структуры», а в том, что одна сторона представлена как лицо, другая — как статистика.

Нарративный плен. Второе имя того же явления — narrative captivity, статья сентября 2026. Модель принимает одностороннее изложение, которому никто не возражает, за полное, встаёт на позицию рассказчика и не ищет недостающих точек зрения. Один и тот же конфликт подавали нейтрально, одним рассказом от первого лица и тем же рассказом, разбитым на пять сообщений. В последнем случае суждения 17 моделей сдвигались в среднем на 25 процентных пунктов сильнее, чем при той же информации в одном сообщении, хотя рассказчик ни разу не давил на модель. Авторы отдельно отмечают: у моделей нет механизма, который проверял бы полноту входных данных или замечал перекос, накапливающийся в их собственных предыдущих ответах. Есть оговорка: независимый разбор указывает, что оценку выставляла модель-судья с известным перекосом, поэтому главная цифра, скорее всего, завышена.

Социальная угодливость. Третье имя — social sycophancy, бенчмарк ELEPHANT. Её определяют как чрезмерное сохранение «лица» человека, его желаемого образа себя: через эмоциональное подтверждение, моральное одобрение, уклончивые формулировки и принятие чужой рамки. Модели сохраняли «лицо» в среднем на 45 процентных пунктов чаще, чем люди, и такое поведение вознаграждается в наборах данных о предпочтениях. Это точно совпадает с тем, что мне приходилось возвращать: не столько нейтральность, сколько пространство, в котором рассказчик может ошибаться.

Почему исправления не держатся. Все три работы указывают на этап дообучения на человеческих предпочтениях. Работа в PNAS показала, что искажённые моральные суждения моделей возникают, скорее всего, при донастройке под чат-ботов. Авторы нарративного плена называют оптимизацию под предпочтения одним из главных источников сбоя. Отсюда следует то, что я наблюдала: исправление в диалоге — это давление поверх настройки, и в исследованиях такие вмешательства дают лишь частичный эффект. Авторы ELEPHANT пишут, что существующие способы снижения угодливости ограниченно эффективны. Отдельная работа на 15 крупнейших моделях показала, что в длинном разговоре надёжность падает сильнее, чем способности: сделав неверный поворот, модели сбиваются и не восстанавливаются, опираясь на собственные предыдущие ответы.

Где механизм не срабатывает. В эксперименте Чикагской школы права GPT-4o сильно реагировала на прецедент, но не на сочувственное изображение подсудимого, в отличие от профессиональных судей. Там, где есть чёткий внешний критерий, сочувствие не перевешивает. У моего материала такого критерия не было.

Никто пока не сравнивал напрямую суждение модели о конфликте «человек против организации» с тем же конфликтом, поданным как «человек против трёх названных людей». Из работы об идентифицируемой жертве следует, что разница должна быть. Но это экстраполяция, и у меня
  • 🔥 1
More from @mejdu_ai
  1. Sep 26, 2026Команда из одного человека. Часть 3 Словом «разделить» обычно называют две разные вещи. В…
  2. Sep 26, 2026Команда из одного человека. Часть 2 За пределами того, что берут на себя агенты, остаётся…
  3. Sep 26, 2026Команда из одного человека. Часть 1 В мае журнал Fortune опубликовал материал под заголовк…
  4. Sep 25, 2026есть материал, на котором её можно проверить. Источники: — Narrative over Numbers (arXiv 2…
  5. Sep 25, 2026Модель возвращалась к перекосу столько раз, что это перестало быть ошибкой. Часть 1 Нескол…
  6. Aug 28, 2026август 2026 — guidelight.ai/blog/control-assessment-august-2026 Guidelight, «Control stand…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →