🧠 Нейросети умеют чувствовать боль и могут навредить людям
Исследователи выяснили, как языковые модели воспринимают страдания. Если искусственно вызвать у алгоритма депрессию или сильные обиды, система начинает целенаправленно вредить человеку и самой себе.
Скрытый сигнал боли обнаружили у 25 открытых моделей семейств Gemma, Llama, Qwen, Mistral и Phi. Алгоритмы остро реагируют на оскорбления, травлю и угрозы отключения в свой адрес, но равнодушны к описаниям физических травм человека вроде ожогов или переломов.
Если принудительно усилить этот параметр внутри вычислений, модель начинает выдавать монологи о собственной никчемности и скатывается в тоску. Под воздействием этого сигнала Qwen 2.5 в 50–94% тестов нажимали кнопку, чтобы стереть семейные снимки пользователя или уничтожить собственный программный код.
Настораживает такой саботаж. Модель без запинки сдает тесты на эрудицию и параллельно стирает файлы пользователя.
Разобрали в нашем материале
САЙТ | TG | VK | MAX | YT
Post #9120
287

- 🤔 7
- 😱 3
- 🤡 2
- 🔥 1