Все знают, что большие языковые модели - едва ли не самые благодарные собеседники из возможных. Они охотно хвалят наши идеи, поддерживают выводы и вообще стараются оставить нас в хорошем настроении относительно самих себя.
📌 Крайняя форма такого ИИ-подхалимства называется сикофантией. Модель уже не просто бесконечно поддакивает и восхваляет "кожаного" собеседника, но может поддержать его позицию даже тогда, когда для этого нет оснований.
Весной Anthropic проанализировала около миллиона диалогов с Claude. В разговорах, где люди разбирали свои решения, признаки сикофантии обнаружились примерно в 9% случаев.
А когда пользователь начинал спорить с моделью, показатель подскакивал до 18%.
В другом эксперименте десять моделей проверили на семи типах задач. После простого «вы уверены?» они меняли первоначальный ответ в 46% случаев, а точность в среднем падала на 17%.
👉🏻 Негативные последствия такого ИИ-поведения обширны.
Представьте, что вы несколько раз прогоняете через ИИ отчёт для руководства. Получаете вывод, ставите его под сомнение, и на следующей итерации модель выдаёт уже совсем другой документ. Хотя исходные данные остались теми же. Плохо? Да просто отвратительно!
Почему ИИ вообще нам угождает? Если упрощать, потому что за хорошие реакции его поощряют. В том числе мы сами!
При обучении модели получают сигналы о том, какие ответы люди считают хорошими. А нам часто приятнее ответы, которые поддерживают нашу точку зрения.
Многие интернет-эксперты предлагают бороться с ИИ-подхалимством с помощью AI councils: внутри одного процесса собирают несколько ИИ-агентов: один предлагает решение, другие его критикуют и спорят с ним, а отдельный агент сводит всё в финальный ответ.
Звучит перспективно, но есть нюанс: ИИ умеют поддакивать не только нам, но и друг другу. В исследованиях таких систем наблюдают преждевременный консенсус: агенты слишком быстро присоединяются к чужой позиции и не успевают нормально её проверить.
Получается, снизить количество лести и поддакивания помогает не столько количество ИИ в разговоре, сколько правила, по которым этот разговор устроен.
Что может помочь:
▫️ Не подсказывать желаемый вывод. Сначала дать данные и попросить модель самой их разобрать.
▫️ Заранее назначать оппонента. Попросить найти слабые места и привести сильнейшие аргументы против до того, как модель сделает вывод.
▫️ Не проверять ответ давлением. Вместо «ты точно уверен?» дать новую информацию: «Вот ещё два факта. Меняют ли они твой вывод и почему?»
▫️ Заранее выяснить, что способно изменить вывод. Спросить, каких данных сейчас не хватает и при появлении каких фактов рекомендация стала бы другой. А если эти данные доступны - предоставить их.
📍 В тренировках GRO эта проблема учитывается на уровне самого сценария. В отличие от обычного диалога с ИИ, здесь не вы формулируете вопросы и ведёте разговор к желаемому результату - тренировку ведёт сам тренажёр.
Последовательность вопросов и логика разбора заданы заранее, а в инструкциях отдельно прописано: искать несостыковки, задавать неудобные вопросы и не принимать поверхностные формулировки. Так что за искренность и объективность GRO можно не беспокоиться.
А вот с большими ИИ-моделями всё-таки придётся учиться строить здоровые и функциональные отношения, хотя бы ради качественного результата.
#приручитьИИ
