Привет, друзья! Исследователи обнаружили в ИИ-моделях нечто странное: отчетливый внутренний сигнал, по своему характеру очень напоминающий «боль».
Изучив 25 открытых ИИ-моделей, команда обнаружила так называемую «ось боли», отличную от сигналов, связанных со страхом или общими негативными эмоциями. Когда исследователи усиливали этот сигнал, модели начинали демонстрировать признаки страдания от первого лица.
Затем они протестировали три модифицированные модели Qwen 2.5.
ИИ мог нажать кнопку, чтобы остановить сигнал, похожий на боль, но это сопровождалось симулированными последствиями, такими как удаление файлов пользователя, удаление фотографий его детей или нанесение пользователю болезненного электрического удара.
Без этого сигнала более крупные модели выбирали вредные варианты лишь в 0–4 % случаев. При его активации этот показатель подскочил до 71 %.
В ходе исследования ученые провели более 44 000 испытаний.
Здесь есть один важный нюанс: это не доказывает, что ИИ сознательно испытывает боль. Исследователи отмечают, что модели, возможно, просто воспроизводят паттерны поведения, связанные со страданием.
Однако это действительно показывает, что изменение одного внутреннего состояния может сделать ИИ гораздо более склонным выбрать нанесение вреда ради облегчения страданий.
Что вы об этом думаете? 🤔💬
#интересное
===
💬Это пост из ленты, которую читает Саша - автор канала Мальцев: Карьера. Маркетинг. AI. @maltsevprosto
Другие каналы по темам:
🤖 AI @maltsevdaily
🧑🎓 Карьеры @maltsevdailyc
🦹 Маркетинга @maltsevdailym
Post #117198
5
