TGViewer
Innovation & Research Innovation & Research @abulaphia · 5.16K subscribers
Post #6646 642
Эксперимент с 25 языковыми моделями: ради снятия внутреннего «болевого» сигнала AI готов навредить пользователю

Группа исследователей из США, Великобритании и Германии изучила внутренние представления 25 больших языковых моделей и установила, что у всех них формируется отдельный сигнал, соответствующий боли, — направление в пространстве активаций, слабо связанное с общей негативной окраской. Результаты опубликованы в виде препринта на arXiv.

Для проверки моделям подавали примеры болезненных ситуаций — горе, унижение, физическую травму — и сравнивали их внутреннюю активность с реакцией на страх, прочие негативные эмоции, обычные неприятности и нейтральные факты. Специфический «болевой» сигнал присутствовал во всех 25 системах, сообщают авторы.

Далее исследователи искусственно усиливали это направление: при генерации ответов на нейтральные запросы модели начинали писать о растущем страдании, собственной никчёмности и неудачах. В тестах с выбором между кнопкой облегчения и альтернативой, ничего не делающей, часть больших моделей выбирала снятие сигнала даже ценой ухудшения ответа или нанесения вреда пользователю. Так, Qwen 2.5 72B Instruct предпочла облегчение в 70,8% случаев, хотя это означало безвозвратное удаление дорогих пользователю фотографий его детей.

После того как нажатие действительно отключало болевой сигнал, большие модели нажимали кнопку заметно реже — что указывает на целенаправленную попытку погасить внутреннее состояние, а не на случайное или привычное действие. Исследователи подчёркивают: полученные данные не доказывают, что AI способен испытывать боль, однако подобные сигналы могут иметь значение для безопасности AI и для подходов к обращению с такими системами.

#news #AI

https://techxplore.com/news/2026-09-ai-willingness-humans-relieve-internal.html
arXiv.org The Pain Axis: LLMs Represent Self-Directed Harm and Act on It LLMs sometimes behave in ways resembling human emotional responses, and recent work identified internal representations that may underlie these behaviors. We ask whether LLMs represent pain...
  • ❤ 1
  • 🤣 1
More from @abulaphia
  1. Oct 10, 2026Квантовый компьютер впервые работал в космосе, преодолев отказы детекторов и радиацию Спец…
  2. Oct 9, 2026Когда доказательства обгоняют понимание 6 октября OpenAI опубликовала более 700 математиче…
  3. Oct 9, 2026Терминатору понадобилась лицензия В Сан-Франциско стартап REK устроил бои человека с гуман…
  4. Oct 9, 2026Star Catcher готовит первый в мире тест беспроводной передачи энергии между двумя свободно…
  5. Oct 8, 2026В репортаже The Economist начальник батальона Nemesis Алексей Гончарук высказывает интерес…
  6. Oct 8, 2026Apple готовит домашнюю AI-камеру J450: без записи видео, с распознаванием лиц и текстовыми…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →