TGViewer
GRO про GRO про @gro_me · 2.57K subscribers
Post #553 310
Кризис ИИ-доверия

Все знают, что большие языковые модели - едва ли не самые благодарные собеседники из возможных. Они охотно хвалят наши идеи, поддерживают выводы и вообще стараются оставить нас в хорошем настроении относительно самих себя.

📌 Крайняя форма такого ИИ-подхалимства называется сикофантией. Модель уже не просто бесконечно поддакивает и восхваляет "кожаного" собеседника, но может поддержать его позицию даже тогда, когда для этого нет оснований.

Весной Anthropic проанализировала около миллиона диалогов с Claude. В разговорах, где люди разбирали свои решения, признаки сикофантии обнаружились примерно в 9% случаев.

А когда пользователь начинал спорить с моделью, показатель подскакивал до 18%.

В другом эксперименте десять моделей проверили на семи типах задач. После простого «вы уверены?» они меняли первоначальный ответ в 46% случаев, а точность в среднем падала на 17%.

👉🏻 Негативные последствия такого ИИ-поведения обширны.

Представьте, что вы несколько раз прогоняете через ИИ отчёт для руководства. Получаете вывод, ставите его под сомнение, и на следующей итерации модель выдаёт уже совсем другой документ. Хотя исходные данные остались теми же. Плохо? Да просто отвратительно!

Почему ИИ вообще нам угождает? Если упрощать, потому что за хорошие реакции его поощряют. В том числе мы сами!

При обучении модели получают сигналы о том, какие ответы люди считают хорошими. А нам часто приятнее ответы, которые поддерживают нашу точку зрения.

Многие интернет-эксперты предлагают бороться с ИИ-подхалимством с помощью AI councils: внутри одного процесса собирают несколько ИИ-агентов: один предлагает решение, другие его критикуют и спорят с ним, а отдельный агент сводит всё в финальный ответ.

Звучит перспективно, но есть нюанс: ИИ умеют поддакивать не только нам, но и друг другу. В исследованиях таких систем наблюдают преждевременный консенсус: агенты слишком быстро присоединяются к чужой позиции и не успевают нормально её проверить.


Получается, снизить количество лести и поддакивания помогает не столько количество ИИ в разговоре, сколько правила, по которым этот разговор устроен.

Что может помочь:

▫️ Не подсказывать желаемый вывод. Сначала дать данные и попросить модель самой их разобрать.
▫️ Заранее назначать оппонента. Попросить найти слабые места и привести сильнейшие аргументы против до того, как модель сделает вывод.
▫️ Не проверять ответ давлением. Вместо «ты точно уверен?» дать новую информацию: «Вот ещё два факта. Меняют ли они твой вывод и почему?»
▫️ Заранее выяснить, что способно изменить вывод. Спросить, каких данных сейчас не хватает и при появлении каких фактов рекомендация стала бы другой. А если эти данные доступны - предоставить их.

📍 В тренировках GRO эта проблема учитывается на уровне самого сценария. В отличие от обычного диалога с ИИ, здесь не вы формулируете вопросы и ведёте разговор к желаемому результату - тренировку ведёт сам тренажёр.

Последовательность вопросов и логика разбора заданы заранее, а в инструкциях отдельно прописано: искать несостыковки, задавать неудобные вопросы и не принимать поверхностные формулировки. Так что за искренность и объективность GRO можно не беспокоиться.

А вот с большими ИИ-моделями всё-таки придётся учиться строить здоровые и функциональные отношения, хотя бы ради качественного результата.

#приручитьИИ
  • 🔥 4
  • ✍ 2
  • ❤ 1
More from @gro_me
  1. Sep 21, 2026К слову о ценности, деньгах и умении говорить о том, что делаешь. Совсем недавно у Екатери…
  2. Sep 21, 2026Сапожник в сапогах (авторская колонка Екатерины Лапшиной) Любимая редакция предложила мне…
  3. Sep 20, 2026Суровое напутствие миллениалов Любимое многими издание Fast Company внимательно наблюдает…
  4. Sep 19, 2026Post #567
  5. Sep 18, 2026Правильная компания Если очень постараться, свою Telegram-ленту можно настроить так, чтобы…
  6. Sep 17, 2026А бирюзовыми ли были? Около десяти лет назад у бизнеса появился новый любимый цвет. После…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →