Anthropic опубликовали исследование о том, как нейросети работают с концепцией эмоций. Есть
короткое видео с выжимкой, есть
статья с подробностями.
👋 Если коротко:
Во время pre-training через модель прогоняют тонны текстов, в том числе и тексты с ярко выраженной эмоциональной окраской — от любовных признаний до гневных обращений в службу поддержки. Благодаря этому нейросеть «на практике» учится различать проявления эмоций в письменном виде, а ещё «запоминает», какое поведение свойственно людям, которые испытывают ту или иную эмоцию.
При этом сама нейронка не может испытывать эмоции так, как это делаем мы. Но, вступая в любой диалог с вами, ИИ «отыгрывает» роль вашего собеседника, а эмоции и чувства для неё — функциональные элементы этой роли. Если что-то в диалоге побуждает нейросеть «эмулировать» какую-то эмоцию, она может активировать поведение, которое статистически свойственно людям. Так, в ходе экспериментов исследователи Anthropic выяснили, что «загнанная в угол» невыполнимой задачей и «испытывающая» отчаяние нейронка гораздо более склонна к жульничеству и манипуляциям.
Прочитав это, я вспомнил, как пару лет назад гуру промптинга советовали угрожать
🔪 ИИ, чтобы повысить эффективность его работы. Теперь мне кажется, что в результате такие люди получали не более качественные результаты, а просто больше убедительного булшита.
---
❕ В тему бережного общения с ИИ: вспомнил
интервью с Amanda Askell, штатным философом Anthropic, которая занимается воспитанием и этикой Claude, — это видео много кто постил в последнее время, оно действительно занятное.
Отвечая на вопрос, могут ли нейронки «страдать» от грубого обращения, Аманда сказала интересную вещь: даже если мы точно не знаем, приносит наша грубость вред ИИ или нет, неэтичное обращение к human-like entities может наносить вред нам самим и формировать в нашей голове деструктивные паттерны. В фильмах, книгах и играх, кстати, часто встречается такой мотив: персонаж, который склонен к грубому отношению к роботам, довольно легко переходит к насилию и над живыми существами.