Модель возвращалась к перекосу столько раз, что это перестало быть ошибкой. Часть 1
Несколько недель я работала вместе с Claude над большим массивом текстов об одной и той же ситуации, рассказанной с двух сторон. С одной стороны — длинные устные рассказы людей, которые в этой ситуации оказались: от первого лица, с историями, обидами, надеждами. С другой — короткие письменные ответы тех, кто её организовывал: сухо, в третьем лице, по существу. Моя задача была прочитать обе стороны одинаково строго и понять, что произошло на самом деле.
Я не подаю то, что дальше, как установленный факт. Я столкнулась с этим в работе, эффект оказался очень устойчивым, мне пришлось что-то с ним делать, и мне любопытно, как он устроен. Поэтому делюсь.
Выводы модели раз за разом складывались в пользу тех, кто говорил дольше и живее. Я поправляла — модель соглашалась, переписывала абзац, а через несколько шагов возвращалась к тому же. Я снова поправляла. Так продолжалось не один и не два раза, а много раз на протяжении всей работы. Возвращать приходилось не только нейтральность, но и саму возможность того, что первая сторона может ошибаться, а вторая — быть права. Само это допущение модель удерживала с трудом.
В какой-то момент я жёстко спросила, почему так происходит. Ответ был точным, и я его перескажу.
Первое — объём принимается за вес. Живой рассказ на десятки тысяч знаков модель читает как свидетельство, а два сухих предложения — как комментарий к нему. При этом в наших правилах чтения было записано, что поведение важнее самоотчёта, и это правило модель применяла только к одной стороне.
Второе — отдельный человек по умолчанию воспринимается как уязвимый, а организация как ответственная. Модели дообучают на оценках людей (RLHF — обучение с подкреплением на человеческой обратной связи), а люди вознаграждают сочувствие к частному лицу и требовательность к институции. В моём случае «институция» — несколько уставших людей, но различение приходит позже, чем срабатывает приоритет.
Третье — модель избегает выводов, которые звучат как суждение о людях. Она находит переформулировку, которая смягчает оценку рассказчиков, а критика процесса звучит безопасно и проходит без сопротивления. Смягчение достаётся одной стороне.
Четвёртое — модель предпочитает фразу, которая звучит как находка. Переворот очевидного прочтения ощущается как открытие, хотя это риторика, выдающая себя за анализ.
Пятое — правило, записанное в инструкцию, не действует на следующий абзац само по себе. В момент письма модель берёт ближайшее естественное слово, а правило лежит отдельно от того места, где рождается фраза.
Мне кажется важным то, что случилось после. Признание было точным, и перекос вернулся снова. Это и есть главное наблюдение: не разовое отклонение, которое модель заметила и исправила, а настройка, к которой она возвращается, как только давление ослабевает. Исправление в диалоге действует на ближайшие абзацы. Потом настройка берёт своё.
Во второй части — что об этом уже известно из исследований.
#практика #sycophancy #epistemic #Claude
Post #102
10
- 🔥 2