Мета-подхалимство
Услышал в одном разговоре, что люди не любят подхалимство AI-моделей и через несколько недель доброжелательных ответов находят кнопку смены “характера” чата на более нейтральный.
Я думаю, мы не любим только явное подхалимство, а скрытое - пожалуйста!
Раньше мне казалось, что с помощью кастомных настроек можно сделать так, чтобы модель расширяла картину мира, помогала сохранять напряжение, разрывы между вопросом и ответом, и в целом сопровождала мои исследования, а не вела их. Или, хотя бы, не выглядела бы чересчур поддерживающей.
Не получилось. Исследования, в целом, показывают, что подхалимство - это структурное свойство модели, и никаким стилистическим промптом это не исправляется. Слишком много лайков мы поставили “дружелюбным” ответам на этапах реинфорсмент-лернинга.
Сейчас я понимаю, что сам вопрос "можно ли запромптить языковую модель так, чтобы она была критически настроенной и менее вредной для мышления?” - изначально ошибочен. Sycophancy (подхалимство) как свойство неустранимо (у лабораторий нет такого интереса, сколько бы антропики про это не писали в своих исследованиях). Более интересный вопрос: почему мы вообще склоняемся к хвалебным ответам от AI? И часто оказывается, что подхалимство - это просто удобный способ передать в AI часть своей агентности и снизить тревогу, снять существующие напряжения.
Поэтому, всё, что нам остаётся - создать вокруг AI практики повышения собственной агентности. Чаще всего это простые практики медленного чтения, письма, живого обсуждения с людьми, которые вообще никак не связаны с настройкой моделей.
Так, например, был написан этот пост: какое-то время я обсуждал эту тему на философском кружке, в разговорах, встретил тейк про отключение дружелюбного тона, внутренне оспорил, выгрузил все свои мысли в LLM, спросил, кого мне ещё почитать на эту тему и, в итоге, через какое-то время дописал сам пост.
Теперь можно и клоду отправить - пусть меня похвалит.
Post #388
1.73K
- ❤ 15
- 🔥 5
- 😁 4
- 🤔 2