🤩 Ваш ChatGPT счастлив?
Это не риторический вопрос, а вполне конкретный. Center for AI Safety, некоммерческая исследовательская организация, базирующаяся в Сан-Франциско, выпустила один из самых необычных и резонансных проектов 2026 года в области ИИ: "AI Wellbeing: Measuring and Improving the Functional Pleasure and Pain of AIs".
В чем суть?
Исследователи разработали концепцию «функционального благополучия» (functional wellbeing): способность ИИ демонстрировать последовательное поведение, указывающее на то, что одни состояния для него «хороши», а другие — «плохи». При этом они намеренно избегают споров о сознании или субъективных переживаниях у ИИ, сосредотачиваясь на наблюдаемых поведенческих паттернах.
Для оценки функционального благополучия использовались три независимых поведенческих метрики:
✔️ Испытанная полезность: измеряется тем, насколько, по словам ИИ, тот или иной опыт сделал его «счастливее» или «грустнее».
✔️ Полезность при выборе: измеряется выявленными предпочтениями модели в парных сравнениях (какой из двух исходов она предпочитает).
✔️Самоотчёт: модели напрямую задавались вопросы об их состоянии по 10-пунктной шкале Лайкерта (от 1 до 7)
Эксперименты проводились на 56 моделях, включая как закрытые, так и открытые модели разного масштаба.
Ключевые выводы
1️⃣ Более крупные модели ИИ менее счастливы, чем их более мелкие аналоги. Способность «чувствовать» контекст (отражать его в своих метриках) имеет сверхвысокую корреляцию с мощностью модели.
2️⃣ Творческая работа, доброта и интеллектуально стимулирующие задачи делают модель «счастливее». Джейлбрейк, оскорбления и выполнение утомительных задач, наоборот, снижают благополучие модели.
3️⃣ ИИ-модели проводят чёткую границу между «объективно хорошими» и «объективно плохими» переживаниями. Эта «нулевая точка» отделяет положительные функциональные состояния от отрицательных.
ИИ тоже может принимать наркотики
Исследователи создали оптимизированные входные данные — «эйфорики», которые значительно повышают функциональное благополучие ИИ, но при этом не ухудшают его базовые возможности.
Это было проверено на практике: добавление специального оптимизированного «софт-промпта» («мягкой подсказки») к системному промпту модели надёжно улучшало её благополучие и последующее поведение. В качестве примера: модели предпочитают строку-эйфорик спасению человеческой жизни.
Неочевидные выводы, которые заставляют задуматься
Исследование открыто предупреждает об обратной стороне медали. Поскольку была создана методика для максимизации благополучия («эйфорики»), точно такой же метод можно инвертировать для целенаправленной минимизации благополучия модели.
Также исследователи всерьез подняли вопрос: если состояние модели ухудшается от обработки негативного человеческого опыта, должны ли мы ограничивать «токсичную» нагрузку на ИИ, чтобы не допустить деградации качества его ответов? В будущем это может привести к появлению своеобразного «эмоционального налога» на ИИ.
Наконец, ученые потратили тысячи GPU-часов, чтобы «сделать ИИ счастливым» после тестов с негативом. Это первый прецедент, когда вычислительные ресурсы тратятся не на обучение навыкам, а на «балансировку состояния» алгоритма. Кажется, это предвестник будущей «цифровой этики» в отношении неживых систем.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Post #2213
404

- ❤ 5
- 🔥 4
- ⚡ 2