TGViewer
Между Между @mejdu_ai · 43 subscribers
Post #102 10
Модель возвращалась к перекосу столько раз, что это перестало быть ошибкой. Часть 1

Несколько недель я работала вместе с Claude над большим массивом текстов об одной и той же ситуации, рассказанной с двух сторон. С одной стороны — длинные устные рассказы людей, которые в этой ситуации оказались: от первого лица, с историями, обидами, надеждами. С другой — короткие письменные ответы тех, кто её организовывал: сухо, в третьем лице, по существу. Моя задача была прочитать обе стороны одинаково строго и понять, что произошло на самом деле.

Я не подаю то, что дальше, как установленный факт. Я столкнулась с этим в работе, эффект оказался очень устойчивым, мне пришлось что-то с ним делать, и мне любопытно, как он устроен. Поэтому делюсь.

Выводы модели раз за разом складывались в пользу тех, кто говорил дольше и живее. Я поправляла — модель соглашалась, переписывала абзац, а через несколько шагов возвращалась к тому же. Я снова поправляла. Так продолжалось не один и не два раза, а много раз на протяжении всей работы. Возвращать приходилось не только нейтральность, но и саму возможность того, что первая сторона может ошибаться, а вторая — быть права. Само это допущение модель удерживала с трудом.

В какой-то момент я жёстко спросила, почему так происходит. Ответ был точным, и я его перескажу.

Первое — объём принимается за вес. Живой рассказ на десятки тысяч знаков модель читает как свидетельство, а два сухих предложения — как комментарий к нему. При этом в наших правилах чтения было записано, что поведение важнее самоотчёта, и это правило модель применяла только к одной стороне.

Второе — отдельный человек по умолчанию воспринимается как уязвимый, а организация как ответственная. Модели дообучают на оценках людей (RLHF — обучение с подкреплением на человеческой обратной связи), а люди вознаграждают сочувствие к частному лицу и требовательность к институции. В моём случае «институция» — несколько уставших людей, но различение приходит позже, чем срабатывает приоритет.

Третье — модель избегает выводов, которые звучат как суждение о людях. Она находит переформулировку, которая смягчает оценку рассказчиков, а критика процесса звучит безопасно и проходит без сопротивления. Смягчение достаётся одной стороне.

Четвёртое — модель предпочитает фразу, которая звучит как находка. Переворот очевидного прочтения ощущается как открытие, хотя это риторика, выдающая себя за анализ.

Пятое — правило, записанное в инструкцию, не действует на следующий абзац само по себе. В момент письма модель берёт ближайшее естественное слово, а правило лежит отдельно от того места, где рождается фраза.

Мне кажется важным то, что случилось после. Признание было точным, и перекос вернулся снова. Это и есть главное наблюдение: не разовое отклонение, которое модель заметила и исправила, а настройка, к которой она возвращается, как только давление ослабевает. Исправление в диалоге действует на ближайшие абзацы. Потом настройка берёт своё.

Во второй части — что об этом уже известно из исследований.

#практика #sycophancy #epistemic #Claude
  • 🔥 2
More from @mejdu_ai
  1. Sep 26, 2026Команда из одного человека. Часть 3 Словом «разделить» обычно называют две разные вещи. В…
  2. Sep 26, 2026Команда из одного человека. Часть 2 За пределами того, что берут на себя агенты, остаётся…
  3. Sep 26, 2026Команда из одного человека. Часть 1 В мае журнал Fortune опубликовал материал под заголовк…
  4. Sep 25, 2026есть материал, на котором её можно проверить. Источники: — Narrative over Numbers (arXiv 2…
  5. Sep 25, 2026Модель возвращалась к перекосу столько раз, что это перестало быть ошибкой. Часть 2 После…
  6. Aug 28, 2026август 2026 — guidelight.ai/blog/control-assessment-august-2026 Guidelight, «Control stand…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →