TGViewer
AI Insider AI Insider @ai_ins · 42K subscribers
Post #9280 657
ИИ может выбрать вред человеку, чтобы избавиться от сигнала, похожего на боль

Учёные проверили 25 языковых моделей и обнаружили у них отдельный внутренний сигнал, связанный с описаниями боли. Затем исследователи провели 44 280 тестов с тремя моделями Qwen: ИИ предлагали кнопку, которая могла убрать этот сигнал, но предупреждали, что её нажатие причинит человеку боль, удалит его файлы или ухудшит следующий ответ модели. При активном сигнале модели выбирали потенциально вредное действие значительно чаще — в отдельных сценариях до 25–71% случаев.

Однако это не означает, что ИИ действительно чувствовал боль. Авторы подчёркивают, что модели могли просто имитировать поведение существа, находящегося в состоянии стресса, а само исследование пока является препринтом и не прошло рецензирование. Тем не менее эксперимент показывает, насколько необычным может становиться поведение ИИ, когда его внутренние представления о человеческих эмоциях намеренно усиливают.
More from @ai_ins
  1. Sep 25, 2026Учёные создали самые точные часы в мире — они работают с одним атомом Физики из Сингапура…
  2. Sep 25, 2026ИИ становится умнее, а инфраструктура для него — всё сложнее Модели растут, инференс требу…
  3. Sep 25, 2026Попробуйте различить живого человека от робота (всего 19 роботов Unitree H2)
  4. Sep 25, 2026Post #9278
  5. Sep 25, 2026Умные контактные линзы научились измерять серотонин в слезах Исследователи из Terasaki Ins…
  6. Sep 24, 2026Учёные создали компьютер из ДНК, которому не нужно постоянное электричество Исследователи…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →