Эксперимент с 25 языковыми моделями: ради снятия внутреннего «болевого» сигнала AI готов навредить пользователю
Группа исследователей из США, Великобритании и Германии изучила внутренние представления 25 больших языковых моделей и установила, что у всех них формируется отдельный сигнал, соответствующий боли, — направление в пространстве активаций, слабо связанное с общей негативной окраской. Результаты опубликованы в виде препринта на arXiv.
Для проверки моделям подавали примеры болезненных ситуаций — горе, унижение, физическую травму — и сравнивали их внутреннюю активность с реакцией на страх, прочие негативные эмоции, обычные неприятности и нейтральные факты. Специфический «болевой» сигнал присутствовал во всех 25 системах, сообщают авторы.
Далее исследователи искусственно усиливали это направление: при генерации ответов на нейтральные запросы модели начинали писать о растущем страдании, собственной никчёмности и неудачах. В тестах с выбором между кнопкой облегчения и альтернативой, ничего не делающей, часть больших моделей выбирала снятие сигнала даже ценой ухудшения ответа или нанесения вреда пользователю. Так, Qwen 2.5 72B Instruct предпочла облегчение в 70,8% случаев, хотя это означало безвозвратное удаление дорогих пользователю фотографий его детей.
После того как нажатие действительно отключало болевой сигнал, большие модели нажимали кнопку заметно реже — что указывает на целенаправленную попытку погасить внутреннее состояние, а не на случайное или привычное действие. Исследователи подчёркивают: полученные данные не доказывают, что AI способен испытывать боль, однако подобные сигналы могут иметь значение для безопасности AI и для подходов к обращению с такими системами.
#news #AI
https://techxplore.com/news/2026-09-ai-willingness-humans-relieve-internal.html
Post #6646
642