TGViewer
Управление людьми по науке Управление людьми по науке @science_of_hr · 8.09K subscribers
Post #1047 494
Доверяй, но проверяй: почему ИИ может убедительно ошибаться

При использовании #AI опаснее всего ситуация, когда он даёт неверный, но убедительный ответ, а пользователь не может независимо проверить вывод.

Steyvers и коллеги изучили ответы GPT-3.5, PaLM2 и GPT-4o на вопросы с выбором и коротким свободным ответом. В эксперименте участникам показывали ответы моделей в разных форматах: только итоговый вариант, краткое объяснение или развёрнутое рассуждение. Затем людей просили оценить, насколько ответ, по их мнению, точен. Оказалось, что при наличии объяснения, особенно длинного и структурированного, участники систематически завышали оценку правильности. Это происходило даже в тех случаях, когда фактическая точность ответа не менялась или оставалась низкой. Более длинный текст повышал субъективную уверенность, но не улучшал объективное качество ответа [1].

Метаанализ Vaccaro, Almaatouq и Malone охватил 106 экспериментов и 370 эффектов, сравнивая три режима: человек без ИИ, ИИ без человека и их совместную работу. Для сопоставления результатов использовалась стандартизированная мера эффекта (Hedges’ g). В среднем комбинация «человек + ИИ» превосходила человека без поддержки, но уступала лучшему из двух участников по отдельности — либо человеку, либо системе (g = −0,23 относительно лучшего из них). Это означает, что добавление второго агента не гарантирует улучшения, если один из них уже справляется лучше.

Эффекты различались по типу задач. В задачах выбора между вариантами (например, диагностика, классификация, принятие решений) совместная работа чаще давала результат хуже лучшего индивидуального (g = −0,27), что авторы связывают с ошибками в распределении доверия: люди либо чрезмерно полагаются на ИИ, либо игнорируют его, когда он прав. В задачах генерации контента (тексты, идеи, дизайн) результаты были более благоприятными: иногда комбинация давала выигрыш, но разброс эффектов был выше и статистическая определённость ниже. Авторы также отмечают, что на итог влияют способ взаимодействия, прозрачность модели и уровень экспертизы пользователя [2].

Важен и порядок работы. Chen и Chan сравнили два сценария подготовки рекламных текстов: ИИ создавал первоначальный вариант или комментировал текст человека. Качество оценивали по реальным кликам в социальных сетях. Для неспециалистов ИИ как «редактор» улучшал результат. Но когда он писал первый вариант за эксперта, качество снижалось. Анализ текстов указывал на якорение: первоначальный ответ ИИ сужал дальнейший поиск решения [3].

Результат определяется не только качеством модели, но и тем, как выстроено взаимодействие: кто формирует первое суждение, способен ли сотрудник распознать ошибку и какую роль играет ИИ в процессе. В задачах с высокой ценой ошибки эффективнее сначала зафиксировать независимый анализ человека, затем использовать ИИ как инструмент критики и поиска альтернатив и обязательно подтверждать итог по данным или через эксперта.

А как вы обычно относитесь к ответам ИИ?

❤️ если всегда перепроверяете важные выводы
👍 если чаще доверяете ответу без дополнительной проверки
  • ❤ 3
More from @science_of_hr
  1. Sep 24, 2026Кажется, что вести сложные переговоры, держать фокус, справляться со стрессом или просить…
  2. Sep 23, 2026Почему с ростом компании становится сложнее быть гибкой У роста есть парадокс: механизмы,…
  3. Sep 22, 2026Гибкость тоже имеет цену Сегодня все говорят о том, что бизнесу нужно быть гибким: быстро…
  4. Sep 18, 2026Экономика HR-решений стартует уже в понедельник Это программа идеально подходит для тех сл…
  5. Sep 16, 2026О стоимости переключения между задачами В прошлый раз мы обсуждали стоимость координации,…
  6. Sep 15, 2026Сколько стоит координация? Когда команда жалуется на бесконечные встречи, кажется хорошей…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →